GAMBIT:面向多智能体 LLM 集合体的对抗鲁棒性三模式基准
计算与语言
2026-05-15 v2 人工智能
机器学习
多智能体系统
摘要
在多智能体系统(MAS)中,单个欺骗性智能体可以完全否定智能体 AI 集合体的所有收益,并规避部署的防御措施。然而,现有的 MAS 对抗研究仅针对浅层任务,且不考虑自适应对手——即其策略会演化以规避所训练的捕捉器。为填补这一空白,我们引入 GAMBIT,一个包含三个评估模式和两个独立得分的基准,用于评估欺骗检测器:前两个模式测量在增加分布迁移下的零样本检测,第三个重校准模式衡量检测器仅凭20个标记样本就适应新攻击的速度。该基准附带一个包含27,804个标记实例、覆盖240种共同演化欺骗策略的数据集。我们的贡献有三个:(1) 使用棋类作为深层推理问题,采用 Gemini 3.1 Pro 作为智能体,我们发布 GAMBIT 及其数据集,以评估在现实约束下、针对狡诈自适应欺骗者的欺骗检测器;(2) 我们引入基于高效进化框架的自适应欺骗智能体,可超越棋类应用,使集合体任务性能崩溃,同时几乎不可被检测( Gemini 基检测器下的 F1 分数为50.5%);(3) 我们表明,零样本评估对自适应对手极其误导:两个得分相近的检测器在少量样本适应上的差异可达8倍,而元学习变体收敛速度快20倍——这一差异仅在重校准模式中可见。总体而言,GAMBIT 提供了首个多智能体基准,使对抗攻击与防御共同演化,包含可超越特定用例的欺骗框架,并为快速重校准在快速演化的对抗系统中提供了有前景的技术。代码与数据:https://anonymous.4open.science/r/gambit。
引用
@article{arxiv.2605.09027,
title = {GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives},
author = {Alexandre Le Mercier and Chris Develder and Thomas Demeester},
journal= {arXiv preprint arXiv:2605.09027},
year = {2026}
}
备注
46 pages, 16 figures