跳到正文
研究计划

研究

我们的团队研究前沿模型的内部运作,使能力、安全与社会影响被测量,而不是被假定。

可解释性 · 对齐 · 评估 · 社会影响
01

可解释性

逆向工程已训练模型的计算,从单个回路到模型规模的行为。

02

对齐

训练目标、价值与拒答在能力增长时仍保持稳定的模型。

03

评估

在部署前建立严格测试,覆盖危险能力与长时程自主性。

04

社会影响

用证据而非轶事,研究人工智能如何改变劳动、科学与公共机构。

档案

出版物

尚无出版物

研究笔记将在发表时出现在这里。以上计划是实验室的框架,不是论文列表。