연구 프로그램
연구
능력·안전·사회적 영향을 가정이 아니라 측정할 수 있도록, 학습된 모델의 내부를 연구합니다.
해석 가능성 · 정렬 · 평가 · 사회적 영향01
해석 가능성
단일 회로부터 모델 규모 행동까지, 학습된 모델의 계산을 역설계합니다.
02
정렬
능력이 커져도 목표·가치·거절이 안정적인 모델을 훈련합니다.
03
평가
위험한 능력과 장기 자율성에 대해, 배포 전 엄격한 시험을 만듭니다.
04
사회적 영향
일화가 아니라 증거로, AI가 노동·과학·공공 기관을 어떻게 바꾸는지 연구합니다.
아카이브
출판물
아직 출판물이 없습니다
연구 노트는 공개할 때 여기에 나옵니다. 위의 프로그램은 연구실의 틀이며 논문 목록이 아닙니다.