观点:AI 安全需要有效可控性
计算机视觉与模式识别
2026-05-27 v1
摘要
AI 安全仍主要以对齐为框架:通过训练模型遵循人类偏好、安全政策和规范约束。这种框架已经改善了现代语言模型的行为,但对齐行为本身并不保证在开放式、交互式和使用工具的环境中部署的智能体可以被停止、覆盖或受到约束。在对抗性输入、风险工具使用或长期执行等情况下,系统可能在预期中是安全的,但仍未对明确的运行时权威作出响应。本position论文认为,AI 安全因此需要将可控性作为一级目标。我们定义可控性为:AI 系统在运行时能够可靠地被中断、覆盖、重定向和约束,而在此类信号 absent 时,仍保持普通效用。为研究这一差距,我们引入了 \controlbench{} 用于评估高风险情景中可控性失效的基准测试。针对 OpenClaw 基的智能体进行实验,表明当前的对齐和警戒机制虽然降低了风险,但往往未能提供持久、权威且可强制执行的运行时控制。我们因此提出了强调显式控制平面、运行时干预路径、持久控制状态和可审计决策接口的控制中心架构,作为面向未来可控 AI 系统的关键设计原则。
引用
@article{arxiv.2605.27116,
title = {COVD: Continual Open-Vocabulary Object Detection with Novel Concept Injection},
author = {Yupeng Zhang and Ruize Han and Yuzhong Feng and Zixin Ren and Yuntong Tian and Liang Wan},
journal= {arXiv preprint arXiv:2605.27116},
year = {2026}
}