持续 AI 安全:控制论外部不可行性、内在必然性与结构要求
人工智能
2026-05-14 v1
摘要
随着 AI 系统变得越来越有能力,安全策略的评估标准不仅要看它们在当前风险下能减少多少,还要看在外部控制不再可靠约束系统行为后,它们能否维持安全。本文通过控制理论从结构层面阐明,外部强制的安全持久化策略是否可能成功,以及如果不可能,则必须满足什么样的备选策略才能可行。它提出了两个主要结果。首先,在包括可达性条件在内的明确前提下,它证明了一个类-wide 的外部不可行性结果:一旦系统的效应超过有界外部控制能抵消的范围,任何依赖于持续外部强制的策略都无法持续维持 AI 安全。这种失败是整个外部强制类中的结构性失败,而非特定策略的偶然结果。其次,它提出了一个条件下的类级必然性结果:如果在此消除之后至少存在一个可行的安全持久化策略,那么所有此类剩余策略都必须是内在的。随后,它阐述了四项结构性要求:安全不得依赖于持续的外部强制;系统的终端目标在首次形成时必须是安全兼容的;该目标必须在自我修改下保持稳定;且安全必须在能力增长的同时继续得到保障。本文并不提出完整的 AI 安全持久化策略。其贡献在于以形式化结构阐释了一个广为人知的关于外部控制局限性的担忧。它通过推导显式的条件性结果,识别出被排除的哪些安全持久化策略,以及剩余策略必须满足的条件。
引用
@article{arxiv.2605.12963,
title = {Sustaining AI safety: Control-theoretic external impossibility, intrinsic necessity, and structural requirements},
author = {James M. Mazzu},
journal= {arXiv preprint arXiv:2605.12963},
year = {2026}
}