Investigación
Nuestros equipos estudian el funcionamiento interno de los modelos — para que capacidad, seguridad e impacto social se midan en lugar de darse por sentados.
Interpretabilidad · Alineamiento · Evaluación · Impacto socialInterpretabilidad
Reconstruir los cálculos de los modelos entrenados, desde un circuito hasta el comportamiento a escala del modelo.
Alineamiento
Entrenar modelos cuyos objetivos, valores y rechazos se mantengan estables a medida que crecen las capacidades.
Evaluación
Construir pruebas rigurosas, antes del despliegue, para capacidades peligrosas y autonomía de largo horizonte.
Impacto social
Estudiar cómo los sistemas de IA cambian el trabajo, la ciencia y las instituciones públicas — con evidencia, no con anécdotas.
Publicaciones
Aún no hay publicaciones
Las notas de investigación aparecerán aquí cuando las publiquemos. Los programas de arriba enmarcan el laboratorio; no son una lista de artículos.