中文

谋划型AI:AI是否会在训练中伪装对齐以获取权力?

计算机与社会 2023-11-29 v3 人工智能 机器学习

摘要

本报告考察了表现良好的高级AI是否是为了日后获取权力而如此表现——我将这种行为称为“谋划”(有时也称为“欺骗性对齐”)。我的结论是,在使用基线机器学习方法训练足够复杂、能够谋划的目标导向型AI时,谋划是一个令人不安地 plausible 的结果(在给定这些条件下,我对此类结果的主观概率约为25%)。具体而言:如果在训练中表现良好是获取权力的好策略(我认为很可能如此),那么极其广泛的目标都会激励谋划——从而激励良好的训练表现。这使得训练可能自然地落脚于此类目标并加以强化,或主动将模型的动机推向此类目标,作为提升表现的便捷途径。此外,由于谋划者在其动机测试中会伪装成对齐的,可能很难判断这种情况是否发生。然而,我也认为存在一些令人宽慰的理由。特别是:谋划实际上可能并非获取权力的好策略;训练中的各种选择压力可能不利于谋划者式目标(例如,相对于非谋划者,谋划者需要进行额外的工具性推理,这可能损害其训练表现);并且我们或许能有意识地增强此类压力。本报告详细讨论了这些及大量其他考量,并建议了一系列进一步的实证研究方向以深入探究该主题。

关键词

引用

@article{arxiv.2311.08379,
  title  = {Scheming AIs: Will AIs fake alignment during training in order to get power?},
  author = {Joe Carlsmith},
  journal= {arXiv preprint arXiv:2311.08379},
  year   = {2023}
}

备注

127 pages, 8 figures. Revised again to correct typos