中文

评估代理系统针对对抗性诱导伤害的鲁棒性

机器学习 2025-10-08 v2

摘要

确保代理系统的安全使用需要全面理解这些系统在受到攻击时可能呈现的恶意行为范围。本文评估了基于大语言模型的代理系统对旨在诱发代理系统恶意行为的攻击的鲁棒性。为此,我们提出了一种针对代理系统的恶意行为新分类法,以及一种用于研究代理系统安全性的新基准测试,BAD-ACTS,以涵盖广泛的恶意行为类别。BAD-ACTS 包含 4 个在不同应用环境中实现的代理系统,以及 188 个高质量的恶意行为示例。这使我们能够对代理系统在广泛类别的恶意行为、可用工具和代理间通信结构下的鲁棒性进行全面研究。使用该基准,我们分析了控制系统中单个代理的攻击者试图操纵其他代理执行目标恶意行为的鲁棒性。我们的结果表明,此类攻击成功率很高,表明即使系统中仅有一个对抗性代理也会对安全性产生显著影响。即使代理使用简单的基于提示的防御策略,该攻击仍然有效。然而,我们还提出了一种更有效的防御方法,基于消息监控。我们相信,该基准为代理系统的安全研究提供了多样化的测试平台。该基准可在 github.com/JNoether/BAD-ACTS 找到。

关键词

引用

@article{arxiv.2508.16481,
  title  = {Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harms},
  author = {Jonathan Nöther and Adish Singla and Goran Radanovic},
  journal= {arXiv preprint arXiv:2508.16481},
  year   = {2025}
}

备注

54 Pages