Ir para o conteúdo
PROGRAMA DE PESQUISA

Pesquisa

Nossas equipes estudam o funcionamento interno dos modelos — para que capacidade, segurança e impacto social sejam medidos, não presumidos.

Interpretabilidade · Alinhamento · Avaliação · Impacto social
01

Interpretabilidade

Reconstruir os cálculos de modelos treinados, de um circuito isolado ao comportamento em escala do modelo.

02

Alinhamento

Treinar modelos cujos objetivos, valores e recusas permaneçam estáveis à medida que as capacidades crescem.

03

Avaliação

Construir testes rigorosos, antes da implantação, para capacidades perigosas e autonomia de longo horizonte.

04

Impacto social

Estudar como sistemas de IA mudam o trabalho, a ciência e as instituições públicas — com evidência, não anedota.

ARQUIVO

Publicações

Ainda não há publicações

Notas de pesquisa aparecerão aqui quando as publicarmos. Os programas acima enquadram o laboratório; não são uma lista de artigos.