PROGRAMA DE PESQUISA
Pesquisa
Nossas equipes estudam o funcionamento interno dos modelos — para que capacidade, segurança e impacto social sejam medidos, não presumidos.
Interpretabilidade · Alinhamento · Avaliação · Impacto social01
Interpretabilidade
Reconstruir os cálculos de modelos treinados, de um circuito isolado ao comportamento em escala do modelo.
02
Alinhamento
Treinar modelos cujos objetivos, valores e recusas permaneçam estáveis à medida que as capacidades crescem.
03
Avaliação
Construir testes rigorosos, antes da implantação, para capacidades perigosas e autonomia de longo horizonte.
04
Impacto social
Estudar como sistemas de IA mudam o trabalho, a ciência e as instituições públicas — com evidência, não anedota.
ARQUIVO
Publicações
Ainda não há publicações
Notas de pesquisa aparecerão aqui quando as publicarmos. Os programas acima enquadram o laboratório; não são uma lista de artigos.