控制 AI 风险的决策路径:AI 治理的基本控制机制
计算机与社会
2025-12-29 v2
摘要
人工智能(AAI)快速发展,但实现对AI风险的完全人类控制仍是一个未解决的问题,类似于在没有“制动系统”的情况下驾驭飞速前进的AI“列车”。通过探索AI决策关键要素处的基本控制机制,我们构建了一个系统性解决方案,为AI治理和立法提供一个由五大支柱支持、由六个控制机制支撑的体系,图示为一套最小的AI命令(AIM)。其中三项AIM必须内置在AI系统中,另外三项则嵌入社会,以解决AI风险的主要领域:1) 将AI价值与人类用户对齐;2) 通过社会伦理、法律和法规约束AI决策行动;3) 在紧急情况和面临存在性威胁时内置人类干预选项和关闭开关;4) 限制AI对用户资源的访问,以强化AI内部的控制;5) 缓解诸如AI导致失业等的溢出风险。我们还指出了在物理AI系统与生成式AI治理上的差异。我们讨论了如何加强类物理安全措施,以防止AI或AGI通过利用AI本质上与物理世界脱节的特性来规避核心安全控制:AI作为纯粹的软件代码运行在受人类控制的芯片上,且所有AI驱动的物理行动必须被数字化。这些发现为AI治理和立法建立了理论基础,作为AI决策“制动系统”的基本结构。如果得到实施,这些控制可以像人类可能的方式一样完全控制AI的危险,显著减少整体AI风险,使其局限于残留的人类错误。
引用
@article{arxiv.2512.04489,
title = {The Decision Path to Control AI Risks Completely: Fundamental Control Mechanisms for AI Governance},
author = {Yong Tao},
journal= {arXiv preprint arXiv:2512.04489},
year = {2025}
}
备注
Added 1 paragraph to Ackowledgements