中文

对齐陷阱:复杂性障碍

人工智能 2025-06-26 v2 计算复杂性 计算机与社会 机器学习

摘要

本文认为,人工智能对齐不仅困难,而且建立在一个基本的逻辑矛盾之上。我们首先确立了枚举悖论:我们使用机器学习正是因为无法枚举所有必要的安全规则,然而使机器学习安全所需的示例只能从我们承认不可能的枚举中生成。这个悖论随后由一组五个独立的数学证明(即“不可能性支柱”)所证实。我们的主要结果表明:(1)几何不可能性:安全策略的集合测度为零,这是将无限维世界上下文需求投影到有限维模型上的必然结果。(2)计算不可能性:验证策略的安全性即使是对于非零误差容限也是 coNP 完全的。(3)统计不可能性:安全所需的训练数据(大量罕见灾难的示例)是一个逻辑矛盾,因此无法获得。(4)信息论不可能性:安全规则包含比任何可行网络所能存储的更多的不可压缩、任意信息。(5)动态不可能性:提高人工智能能力的优化过程对安全性是积极敌对的,因为这两个目标的梯度通常是反对齐的。总之,这些结果表明,追求安全、高能力的人工智能不是克服技术障碍的问题,而是面对基本的、相互关联的障碍。本文最后提出了这些不可能性强加给该领域的战略三难困境。核心定理在 Lean4 中的形式化验证目前正在进行中。

关键词

引用

@article{arxiv.2506.10304,
  title  = {The Alignment Trap: Complexity Barriers},
  author = {Jasper Yao},
  journal= {arXiv preprint arXiv:2506.10304},
  year   = {2025}
}

备注

31 Pages, 4 Figures. Substantial revision. Restructured around the Enumeration Paradox and Five Pillars of Impossibility. Core mathematical results unchanged but significantly expanded. Added new impossibility proofs from statistical, information-theoretic, and dynamic perspectives