研究プログラム
研究
能力・安全性・社会的影響を仮定ではなく測定できるよう、学習済みモデルの内部を調べます。
解釈可能性 · アライメント · 評価 · 社会的影響01
解釈可能性
単一回路からモデル規模の振る舞いまで、学習済みモデルの計算を逆工程します。
02
アライメント
能力が伸びても、目的・価値・拒否が安定しているモデルを訓練します。
03
評価
危険な能力と長期の自律性について、配備前の厳密な試験を組み立てます。
04
社会的影響
逸話ではなく証拠に基づき、AIが労働・科学・公的機関をどう変えるかを調べます。
アーカイブ
刊行物
まだ刊行物はありません
研究ノートは公開したときにここに出ます。上のプログラムは研究室の枠組みであり、論文一覧ではありません。