Aller au contenu
PROGRAMME DE RECHERCHE

Recherche

Nos équipes étudient le fonctionnement interne des modèles — pour que capacité, sûreté et impact sociétal se mesurent plutôt qu’ils ne s’assument.

Interprétabilité · Alignement · Évaluation · Impact sociétal
01

Interprétabilité

Reconstituer les calculs des modèles entraînés, du circuit isolé au comportement à l’échelle du modèle.

02

Alignement

Entraîner des modèles dont les objectifs, les valeurs et les refus restent stables à mesure que les capacités croissent.

03

Évaluation

Construire des tests rigoureux, avant déploiement, pour les capacités dangereuses et l’autonomie sur le long horizon.

04

Impact sociétal

Étudier comment les systèmes d’IA transforment le travail, la science et les institutions publiques — avec des preuves, pas des anecdotes.

ARCHIVES

Publications

Pas encore de publications

Les notes de recherche paraîtront ici lorsque nous les publierons. Les programmes ci-dessus cadrent le laboratoire ; ce n’est pas une liste d’articles.