为何智能体安全性无法跨任务泛化?
机器学习
2026-05-11 v1 机器学习
摘要
AI 智能体越来越多地被部署于多任务场景中,其中待执行的任务在测试时指定,且智能体必须泛化至未见任务。此类场景中的一个主要关切是安全性:智能体通常不仅要执行未见任务,还须在执行过程中规避风险并处理已显现的风险。经验证据表明,即使执行能力泛化至未见任务,安全执行的能力往往无法随之泛化。本文提供了理论与实验表明,智能体安全性跨任务泛化的失败并非仅仅源于训练方法的局限,而是反映了安全性本身的固有属性:任务与其安全执行之间的关系比任务与其单独执行之间的关系更为复杂。在理论上,我们分析了具有 鲁棒性的线性二次控制,并证明带有安全要求的任务规范到最优控制器的映射比无安全要求时具有更大的 Lipschitz 常数,从而得出了具有独立意义的 Lipschitz 界。在经验上,我们在使用神经网络智能体的模拟四旋翼导航以及使用 LLM 智能体的 CRM 中验证了我们的结论。我们的发现表明,当前增强智能体安全性的努力可能是不充分的,并指出需要根本不同的方法。
引用
@article{arxiv.2605.06992,
title = {Why Does Agentic Safety Fail to Generalize Across Tasks?},
author = {Yonatan Slutzky and Yotam Alexander and Tomer Slor and Yoav Nagel and Nadav Cohen},
journal= {arXiv preprint arXiv:2605.06992},
year = {2026}
}