中文

多智能体暗中游戏:基于反事实测试消除幻觉的多模态推理

人工智能 2025-11-17 v1 计算与语言 多智能体系统 多媒体

摘要

幻觉持续构成大型语言模型(LLM)推理能力的主要障碍。虽然多智能体辩论(MAD)范例提供了通过促进多个智能体间共识以提升可靠性的有前景的解决方案,但其依赖所有辩论者都具备理性与反思能力这一不切实际的假设,这在智能体本身容易产生幻觉的情况下可能难以成立。为此,我们引入受「谁是伪装者」等社交推理游戏启发的多智能体暗中游戏(MUG)协议。MUG 将 MAD 重新定义为检测「伪装」智能体(即受幻觉影响的智能体)的过程,通过采用多模态反事实测试来实现。具体而言,我们修改参考图像以引入反事实证据,并观察智能体是否能准确识别这些变更,从而提供真实性依据以识别幻觉智能体,进而实现稳健、群体驱动的多模态推理。MUG 在以下三个关键维度上推进 MAD 协议:(1)通过反事实测试实现对统计共识之外的事实性验证;(2)通过动态修改的证据来源引入跨证据推理,而非依赖静态输入;(3)促进主动推理,使智能体参与探针性讨论而非被动作答问题。综合这些创新,为 LLM 的多模态推理提供了更可靠且更有效的框架。源代码可在 https://github.com/YongLD/MUG.git 访问。

关键词

引用

@article{arxiv.2511.11182,
  title  = {Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning},
  author = {Dayong Liang and Xiao-Yong Wei and Changmeng Zheng},
  journal= {arXiv preprint arXiv:2511.11182},
  year   = {2025}
}

备注

Accepted by AAAI 2026