Recherche
Nos équipes étudient le fonctionnement interne des modèles — pour que capacité, sûreté et impact sociétal se mesurent plutôt qu’ils ne s’assument.
Interprétabilité · Alignement · Évaluation · Impact sociétalInterprétabilité
Reconstituer les calculs des modèles entraînés, du circuit isolé au comportement à l’échelle du modèle.
Alignement
Entraîner des modèles dont les objectifs, les valeurs et les refus restent stables à mesure que les capacités croissent.
Évaluation
Construire des tests rigoureux, avant déploiement, pour les capacités dangereuses et l’autonomie sur le long horizon.
Impact sociétal
Étudier comment les systèmes d’IA transforment le travail, la science et les institutions publiques — avec des preuves, pas des anecdotes.
Publications
Pas encore de publications
Les notes de recherche paraîtront ici lorsque nous les publierons. Les programmes ci-dessus cadrent le laboratoire ; ce n’est pas une liste d’articles.