研究计划
研究
我们的团队研究前沿模型的内部运作,使能力、安全与社会影响被测量,而不是被假定。
可解释性 · 对齐 · 评估 · 社会影响01
可解释性
逆向工程已训练模型的计算,从单个回路到模型规模的行为。
02
对齐
训练目标、价值与拒答在能力增长时仍保持稳定的模型。
03
评估
在部署前建立严格测试,覆盖危险能力与长时程自主性。
04
社会影响
用证据而非轶事,研究人工智能如何改变劳动、科学与公共机构。
档案
出版物
尚无出版物
研究笔记将在发表时出现在这里。以上计划是实验室的框架,不是论文列表。