中文

AI的混乱:失调如何随模型智能和任务复杂性扩展?

人工智能 2026-04-13 v2

摘要

随着AI能力越来越强,我们将其委托给更通用和更重要的任务。随着任务范围的扩大,失败的风险变得更加严重。因此,理解极其强大的AI模型将如何失败至关重要:它们会通过系统性地追求我们无意设定的目标而失败吗?还是会因为混乱不堪,采取不推进任何目标的荒谬行动而失败?我们使用AI模型所犯错误的偏差-方差分解来操作化这个问题:AI在任务上的“错误-不连贯性”是通过测试时随机性来衡量的,即其错误中源于方差而非任务结果偏差的比例。在我们测量的所有任务和前沿模型中,模型花在推理和行动上的时间越长,其失败就越不连贯。错误-不连贯性随模型规模的变化方式取决于实验。然而,在几种设置中,更大、更强大的模型比较小的模型更不连贯。因此,仅靠规模似乎不太可能消除错误-不连贯性。相反,随着更强大的AI追求更困难的任务,需要更多的顺序行动和思考,我们的结果预测失败将伴随着更不连贯的行为。这表明未来AI有时会导致工业事故(由于不可预测的不当行为),但不太可能表现出对失调目标的一致追求。这增加了针对奖励破解或目标错误指定的对齐研究的相对重要性。

关键词

引用

@article{arxiv.2601.23045,
  title  = {The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?},
  author = {Alexander Hägele and Aryo Pradipta Gema and Henry Sleight and Ethan Perez and Jascha Sohl-Dickstein},
  journal= {arXiv preprint arXiv:2601.23045},
  year   = {2026}
}

备注

ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references