中文

AI 安全即不可逆性控制:面向决策能量与主权边界的系统框架

人工智能 2026-05-05 v1 计算机与社会

摘要

近期 AI 系统正在压缩能力增长与能力部署之间的距离。早期的高风险技术因资本强度、物理瓶颈、组织惯性和专业供应链等因素受到阻碍。相比之下,AI 能力可以以低的边际成本复制、调用、嵌入工作流程,并跨机构规模化。本文认为,部署摩擦的降低从根本上改变了安全问题。安全不仅是局部输出正确性或偏好对齐,更是面对日益增加的决策密度下的不可逆性控制。本文通过决策能量密度(节点生成、评估、选择和执行具有意义决策的速率加权容量)对此主张进行形式化建模。随后,本文识别了三种主权边界,决定着 AI 是否仍为人类治理体系下的放大器,抑或成为事实上的控制中心:不可逆决策权威、物理资源动员权威以及自我扩张权威。该模型展示了如何通过效率压力、路径依赖、规模反馈以及边界约束薄弱,使决策能量在最高效节点中集中。这种集中可能导致责任的扩散,即使局部行动错误率保持较低,也会增加不可逆系统级损失的概率。主要结果是边界稳定定理。它表明,安全问题不必要求证明高级系统始终正确,而是需要制度和技术设计,以防止单个高效节点释放不可逆权力。本文将 AI 安全重新框架化为分层控制、授权以及外部可审查限制,联系了对齐、安全工程、组织经济学和制度设计。

关键词

引用

@article{arxiv.2605.01415,
  title  = {AI Safety as Control of Irreversibility: A Systems Framework for Decision-Energy and Sovereignty Boundaries},
  author = {Wesley Shu and Peng Wei},
  journal= {arXiv preprint arXiv:2605.01415},
  year   = {2026}
}