SafeAgent:通过自动化风险模拟器保护 LLM 智能体
人工智能
2025-07-21 v2
摘要
大型语言模型 (LLM) 智能体正在被部署到诸如"数字助手、自动客户服务和决策支持系统"等实际应用中,其通过"在多轮、工具增强环境中与用户交互"的能力使其成为不可或缺的。然而,由于源于动态用户交互、外部工具使用以及潜在意外有害行为的多样性和复杂风险,确保这些智能体的安全性仍是一个重大挑战。为此,我们提出了 AutoSafe,即第一个通过完全自动化合成数据生成系统来系统性提升智能体安全性的框架。具体而言,我们引入了开放且可扩展的威胁模型 OTS,该模型正式化了不安全行为如何从用户指令、交互上下文和智能体动作之间的相互作用中产生。这使得能够在 diverse 场景中精确建模安全风险。我们开发了一个完全自动化的数据生成管道,该管道模拟不安全的用户行为,应用自我反思推理以生成安全响应,并构建一个大规模、多样且高质量的安全训练数据集,无需收集有害的真实世界数据。为评估该框架的有效性,我们在 synthetic 和 real-world 安全基准上设计了全面的实验。结果表明,AutoSafe 在平均安全得分上提升了 45%,在 real-world 任务中实现了 28.91% 的改进,验证了所学安全策略的泛化能力。这些结果突显了 AutoSafe 在构建更安全的 LLM 智能体以实现实际部署方面的实用性和可扩展性。我们已在 https://auto-safe.github.io/ 上发布项目页面。
引用
@article{arxiv.2505.17735,
title = {SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator},
author = {Xueyang Zhou and Weidong Wang and Lin Lu and Jiawen Shi and Guiyao Tie and Yongtian Xu and Lixing Chen and Pan Zhou and Neil Zhenqiang Gong and Lichao Sun},
journal= {arXiv preprint arXiv:2505.17735},
year = {2025}
}
备注
38 pages;12 figures;12 tables