中文

策略一致代理的有效红队测试

多智能体系统 2025-08-26 v3 人工智能 计算与语言 密码学与安全

摘要

面向任务的基于大语言模型 (LLM) 的代理日益被用于具有严格政策的领域,如退款资格或取消规则。挑战在于确保代理持续遵守这些规则和政策,同时以恰当方式拒绝任何违反政策的请求,维持有帮助且自然的交互。这需要开发针对性的设计和评估方法,以确保代理对恶意用户行为具有韧性。我们提出了一种新威胁模型,聚焦于旨在获取个人利益而攻击政策一致代理的对手用户。为此,我们提出了 CRAFT 系统,这是一个多代理人红队系统,利用政策感知的说服策略来挑战客户服务情境下的政策一致代理,超越了 DAN 提示、情感操纵和强制等常规越狱方法。基于现有 tau-bench 基准,我们引入 tau-break,一个旨在严格评估代理对操纵性用户行为韧性的补充基准。最后,我们评估了几种简单且有效的防御策略。虽然这些措施提供了一些保护,但仍不足,以突显需要更强、以研究为导向的防护措施来保护政策一致代理免受对手攻击。

关键词

引用

@article{arxiv.2506.09600,
  title  = {Effective Red-Teaming of Policy-Adherent Agents},
  author = {Itay Nakash and George Kour and Koren Lazar and Matan Vetzler and Guy Uziel and Ateret Anaby-Tavor},
  journal= {arXiv preprint arXiv:2506.09600},
  year   = {2025}
}