中文

失控情景蓝图:程度、动力学与准备就绪

计算机与社会 2025-12-09 v5 人工智能

摘要

本研究报告针对 AI 系统中缺乏可操作性定义的“失控”(Loss of Control, LoC)问题,提出了新型分类学与准备框架。尽管政策与研究注意力日益增加,现有 LoC 定义在范围和时间线上差异巨大,致使有效评估和缓解 LoC 受阻。为此,我们综合大量文献,提出基于严重程度与持续时间指标的分级 LoC 分类学,将其区分为“偏差”(Deviation)、“受限失控”(Bounded LoC)和“严格失控”(Strict LoC)三类。我们构建了社会脆弱状态的路径模型——在该状态下,足够先进的 AI 系统已获得或可能获得导致受限失控或严格失控的手段,一旦触发器(如误对齐或故障)发生,便可能造成损害。我们认为,缺乏战略干预,该状态随时间推移将越来越可能。我们提出策略以避免进入脆弱状态。与仅关注干预 AI 能力与倾向或防止潜在触发器不同,我们引入强调三项外在因素的框架:部署情境、可行性与许可(DAP 框架)。该框架相较内在因素与触发器,具有可立即行动的优势。最后,我们提出维持准备就绪、防止 LoC 结果发生的计划,聚焦治理措施(威胁建模、部署政策、紧急响应)和技术控制(部署前测试、控制措施、监控),以维持持续的暂停状态。

关键词

引用

@article{arxiv.2511.15846,
  title  = {The Loss of Control Playbook: Degrees, Dynamics, and Preparedness},
  author = {Charlotte Stix and Annika Hallensleben and Alejandro Ortega and Matteo Pistillo},
  journal= {arXiv preprint arXiv:2511.15846},
  year   = {2025}
}