FORSCHUNGSPROGRAMM
Forschung
Unsere Teams untersuchen die inneren Abläufe von Modellen — damit Fähigkeit, Sicherheit und gesellschaftliche Wirkung gemessen statt angenommen werden.
Interpretierbarkeit · Alignment · Evaluation · Gesellschaftliche Wirkung01
Interpretierbarkeit
Die Berechnungen trainierter Modelle rekonstruieren, vom einzelnen Schaltkreis bis zum Verhalten in Modellgröße.
02
Alignment
Modelle trainieren, deren Ziele, Werte und Ablehnungen stabil bleiben, während die Fähigkeiten wachsen.
03
Evaluation
Strenge Tests vor dem Einsatz für gefährliche Fähigkeiten und Autonomie über lange Horizonte.
04
Gesellschaftliche Wirkung
Untersuchen, wie KI-Systeme Arbeit, Wissenschaft und öffentliche Institutionen verändern — mit Belegen, nicht Anekdoten.
ARCHIV
Publikationen
Noch keine Publikationen
Forschungsnotizen erscheinen hier, wenn wir sie veröffentlichen. Die Programme oben rahmen das Labor; sie sind keine Artikelliste.