中文

GAMBIT:面向多智能体 LLM 集合体的对抗鲁棒性三模式基准

计算与语言 2026-05-15 v2 人工智能 机器学习 多智能体系统

摘要

在多智能体系统(MAS)中,单个欺骗性智能体可以完全否定智能体 AI 集合体的所有收益,并规避部署的防御措施。然而,现有的 MAS 对抗研究仅针对浅层任务,且不考虑自适应对手——即其策略会演化以规避所训练的捕捉器。为填补这一空白,我们引入 GAMBIT,一个包含三个评估模式和两个独立得分的基准,用于评估欺骗检测器:前两个模式测量在增加分布迁移下的零样本检测,第三个重校准模式衡量检测器仅凭20个标记样本就适应新攻击的速度。该基准附带一个包含27,804个标记实例、覆盖240种共同演化欺骗策略的数据集。我们的贡献有三个:(1) 使用棋类作为深层推理问题,采用 Gemini 3.1 Pro 作为智能体,我们发布 GAMBIT 及其数据集,以评估在现实约束下、针对狡诈自适应欺骗者的欺骗检测器;(2) 我们引入基于高效进化框架的自适应欺骗智能体,可超越棋类应用,使集合体任务性能崩溃,同时几乎不可被检测( Gemini 基检测器下的 F1 分数为50.5%);(3) 我们表明,零样本评估对自适应对手极其误导:两个得分相近的检测器在少量样本适应上的差异可达8倍,而元学习变体收敛速度快20倍——这一差异仅在重校准模式中可见。总体而言,GAMBIT 提供了首个多智能体基准,使对抗攻击与防御共同演化,包含可超越特定用例的欺骗框架,并为快速重校准在快速演化的对抗系统中提供了有前景的技术。代码与数据:https://anonymous.4open.science/r/gambit。

关键词

引用

@article{arxiv.2605.09027,
  title  = {GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives},
  author = {Alexandre Le Mercier and Chris Develder and Thomas Demeester},
  journal= {arXiv preprint arXiv:2605.09027},
  year   = {2026}
}

备注

46 pages, 16 figures