中文

安全通用逼近器的数学不可行性

机器学习 2025-07-08 v1 人工智能

摘要

我们确立了关于通用逼近定理(UAT)系统对齐的根本数学限制,证明灾难性失效是任何有用计算系统不可避免的特征。我们的核心论点是,对于任何通用逼近器,实现有用计算所需的表达力与密集的不稳定性集合密切相关,这使得完美、可靠的控制成为数学上的不可能。我们通过三个层次的论证构建了此结论,为任何类通用逼近器架构都没有逃脱之路。i) 组合必然性:对于绝大多数实际的通用逼近器(例如使用 ReLU 激活函数的网络),我们证明了灾难性失效点的密度与网络表达力成正比。ii) 拓扑必然性:对于任何理论上的通用逼近器,我们使用奇点理论证明,逼近通用函数的能力要求能够实现这些函数特征化的稠密灾难性奇点。iii) 经验必然性:我们证明,针对性样本的普遍存在是现实任务本身即是灾难性的经验证据,迫使任何成功的模型都必须学习并复制这些不稳定性。这些结果结合了一个定量的“不可避免夹层”——即有用性的最低复杂度超过安全性的最高复杂度——表明,完美对齐并非工程挑战,而是数学上的不可能。这一基础性结果将UAT安全从“如何实现完美控制”的难题,重新定义为“如何在不可控性不可避免的环境中安全运行”的难题,对UAT的未来发展和治理具有深远影响。

关键词

引用

@article{arxiv.2507.03031,
  title  = {On the Mathematical Impossibility of Safe Universal Approximators},
  author = {Jasper Yao},
  journal= {arXiv preprint arXiv:2507.03031},
  year   = {2025}
}

备注

17 pages