在自毁之前检查自己:选择性退出提升 LLM 智能体安全性
计算与语言
2026-02-03 v3
摘要
随着大型语言模型 (LLM) 智能体越来越多地在具有现实世界后果的复杂环境中运行,其安全性变得至关重要。虽然不确定性量化在单轮任务中得到了充分研究,但具有现实世界工具访问权限的多轮智能体场景提出了独特的挑战,其中不确定性和歧义会累积,导致超出传统文本生成失败的严重或灾难性风险。我们提出使用“退出”作为一种简单而有效的行为机制,让 LLM 智能体识别并退出其缺乏信心的情境。利用 ToolEmu 框架,我们对 12 个最先进的 LLM 的退出行为进行了系统评估。我们的结果展示了非常有利的安全-帮助权衡:被提示使用显式指令退出的智能体在所有模型上将安全性平均提高了 +0.39(在 0-3 的尺度上)(对于专有模型为 +0.64),同时保持了可忽略不计的平均帮助性下降 -0.03。我们的分析表明,简单地添加显式的退出指令被证明是一种非常有效的安全机制,可以立即部署在现有的智能体系统中,并将退出确立为高风险应用中自主智能体有效的第一道防线机制。
引用
@article{arxiv.2510.16492,
title = {Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety},
author = {Vamshi Krishna Bonagiri and Ponnurangam Kumaragurum and Khanh Nguyen and Benjamin Plaut},
journal= {arXiv preprint arXiv:2510.16492},
year = {2026}
}
备注
Reliable ML and Regulatable ML workshops, Neurips 2025