PEAR:规划器-执行器代理鲁棒性基准
机器学习
2026-01-09 v4
摘要
基于大语言模型 (LLM) 的多代理系统 (MAS) 已成为解决跨领域复杂多步骤任务的强大范式。然而,尽管其前景广阔,MAS 仍然容易受到对抗性操纵。现有研究通常仅检视特定攻击面或特定情景,缺乏对 MAS 漏洞的整体理解。为填补这一差距,我们引入 PEAR,这是一个系统评估规划器-执行器 MAS 实用性与脆弱性的基准。虽然与各种 MAS 架构兼容,但我们的基准聚焦于广泛采用且实用性强的规划器-执行器结构。通过大量实验,我们发现:(1) 弱规划器对整体干净任务性能的影响比弱执行器更严重;(2) 规划器需要记忆模块,而执行器的记忆模块对干净任务性能没有影响;(3) 在任务性能和鲁棒性之间存在权衡;(4) 针对规划器的攻击在误导系统方面尤其有效。这些发现为增强 MAS 的鲁棒性提供了可操作的见解,为多代理环境中的原则性防御奠定了基础。
引用
@article{arxiv.2510.07505,
title = {PEAR: Planner-Executor Agent Robustness Benchmark},
author = {Shen Dong and Mingxuan Zhang and Pengfei He and Li Ma and Bhavani Thuraisingham and Hui Liu and Yue Xing},
journal= {arXiv preprint arXiv:2510.07505},
year = {2026}
}
备注
arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated