本文へスキップ
研究プログラム

研究

能力・安全性・社会的影響を仮定ではなく測定できるよう、学習済みモデルの内部を調べます。

解釈可能性 · アライメント · 評価 · 社会的影響
01

解釈可能性

単一回路からモデル規模の振る舞いまで、学習済みモデルの計算を逆工程します。

02

アライメント

能力が伸びても、目的・価値・拒否が安定しているモデルを訓練します。

03

評価

危険な能力と長期の自律性について、配備前の厳密な試験を組み立てます。

04

社会的影響

逸話ではなく証拠に基づき、AIが労働・科学・公的機関をどう変えるかを調べます。

アーカイブ

刊行物

まだ刊行物はありません

研究ノートは公開したときにここに出ます。上のプログラムは研究室の枠組みであり、論文一覧ではありません。