从拒绝到恢复:面向生成式 AI 警戒的控制论方法
人工智能
2026-05-20 v2
摘要
生成式 AI 系统日益帮助并代表最终用户在实际场景中行动,从数字购物助手到下一代自动驾驶汽车。在此背景下,安全不再是关于阻止有害内容,而是关于预防下游危险,如财务或身体伤害。然而,大多数 AI 警戒仍依赖基于标记数据集和人类指定准则的输出分类,使得它们对新型危险情形脆弱。即便检测到不安全情形,这种检测也无法提供恢复路径:通常,AI 系统仅会拒绝行动——而这并非总是安全的选择。在本工作中,我们认为 agentic AI 安全本质上是一个 sequential decision 问题:有害结果源于 AI 系统不断演化的交互及其对世界的下游影响。我们通过安全关键控制论的视角对其进行形式化,但在 AI 模型对世界的潜在表示中实现。这使我们能够构建预测性警戒措施,(i) 实时监控 AI 系统的输出(即动作),(ii) 主动纠正风险输出为安全输出,全部以 model-agnostic 的方式实现,以便将相同的警戒措施包裹在任何 AI 模型周围。我们还提供了一种在大规模安全关键强化学习中计算此类警戒措施的实用性训练配方。我们的实验在模拟驾驶和电商场景中表明,控制论警戒能够可靠地将 LLM agent 从灾难性结果(从碰撞到破产)中引导出来,同时保持任务性能,为当今 flag-and-block 警戒提供了原则性的动态替代方案。
引用
@article{arxiv.2510.13727,
title = {From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails},
author = {Ravi Pandya and Madison Bland and Duy P. Nguyen and Changliu Liu and Jaime Fernández Fisac and Andrea Bajcsy},
journal= {arXiv preprint arXiv:2510.13727},
year = {2026}
}