中文

M$^3$-ACE:通过多智能体上下文工程纠正多模态数学推理中的视觉感知

人工智能 2026-03-10 v1

摘要

多模态大语言模型最近在视觉数学推理方面取得了令人鼓舞的进展。然而,其性能往往受到一个关键且鲜有人关注的瓶颈限制:视觉感知不准确。通过系统性分析,我们发现大多数错误源于错误或不完整的视觉证据提取,而非推理能力不足。此外,模型倾向于对初始感知保持过度自信,使得标准策略(如提示工程、多轮自我反思或后验引导)不足以可靠地纠正错误。为此,我们提出 M3-ACE(Multi-Agentic Context Engineering),一个旨在纠正多模态数学推理中视觉感知的多智能体上下文工程框架。我们的做法不直接聚合最终答案,而是通过动态维护以视觉证据列表为中心的共享上下文,来解耦感知与推理。多个智能体协作贡献互补的观察,使系统能够暴露不一致性并恢复缺失的感知信息。为支持稳定的多轮协作,我们进一步引入两个轻量级工具:一个汇总工具(Summary Tool),将来自不同智能体的证据组织为一致、互补和冲突的组成部分;以及一个精炼工具(Refine Tool),筛选不可靠样本并引导迭代纠正。大量实验表明,M3-ACE 在多个基准上显著提升了视觉数学推理性能。我们的模型在 MathVision 基准上取得了 89.1 的最新状态最佳结果,并在其他相关数据集(包括 MathVista 和 MathVerse)上实现持续的性能提升。这些结果凸显了感知导向的多智能体协作在推进多模态推理系统方面的重要性。

关键词

引用

@article{arxiv.2603.08369,
  title  = {M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering},
  author = {Peijin Xie and Zhen Xu and Bingquan Liu and Baoxun Wang},
  journal= {arXiv preprint arXiv:2603.08369},
  year   = {2026}
}