본문으로 건너뛰기
연구 프로그램

연구

능력·안전·사회적 영향을 가정이 아니라 측정할 수 있도록, 학습된 모델의 내부를 연구합니다.

해석 가능성 · 정렬 · 평가 · 사회적 영향
01

해석 가능성

단일 회로부터 모델 규모 행동까지, 학습된 모델의 계산을 역설계합니다.

02

정렬

능력이 커져도 목표·가치·거절이 안정적인 모델을 훈련합니다.

03

평가

위험한 능력과 장기 자율성에 대해, 배포 전 엄격한 시험을 만듭니다.

04

사회적 영향

일화가 아니라 증거로, AI가 노동·과학·공공 기관을 어떻게 바꾸는지 연구합니다.

아카이브

출판물

아직 출판물이 없습니다

연구 노트는 공개할 때 여기에 나옵니다. 위의 프로그램은 연구실의 틀이며 논문 목록이 아닙니다.