中文

AegisLLM:面向 LLM 安全的自反省防御的代理系统扩展

机器学习 2025-06-17 v2

摘要

我们提出 AegisLLM,这是一个针对对抗攻击和信息泄露的协作式多代理防御。在 AegisLLM 中,结构化的自主代理工作流程 - orchestrator、deflector、responder 和 evaluator - 协作确保 LLM 输出的安全性和合规性,同时通过 prompt 优化实现自我改进。我们表明,扩大代理推理系统的规模进行测试时 - 无论是通过增加代理角色,还是通过利用自动化 prompt 优化 (如 DSPy) - 都能在不牺牲模型实用性的前提下显著提升鲁棒性。这种测试时防御使系统能够实时适应不断演变的攻击,无需重新训练模型。针对关键威胁情景,包括 unlearning 和 jailbreaking,进行了全面评估,证明了 AegisLLM 的有效性。在 WMDP unlearning 基准测试中,AegisLLM 仅用 20 条训练示例和不到 300 次 LM 调用即可实现近乎完美的 unlearning。对于 jailbreaking 基准测试,在 StrongReject 上比基础模型提高了 51%,在 PHTest 上误拒率仅 7.9%,远低于类似方法的 18-55%。我们的结果表明,自适应的代理推理优于静态防御,使 AegisLLM 成为传统基于模型修改方法的强大的运行时替代方案。代码已提供于 https://github.com/zikuicai/aegisllm

关键词

引用

@article{arxiv.2504.20965,
  title  = {AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security},
  author = {Zikui Cai and Shayan Shabihi and Bang An and Zora Che and Brian R. Bartoldson and Bhavya Kailkhura and Tom Goldstein and Furong Huang},
  journal= {arXiv preprint arXiv:2504.20965},
  year   = {2025}
}

备注

ICLR 2025 Workshop BuildingTrust