中文

MC-Search: 基于结构化长推理链的多模态代理搜索评估与提升

人工智能 2026-03-03 v1

摘要

随着对逐步、跨模态和知识 grounding 推理需求的增长,多模态大语言模型(MLLMs)正发展超越传统的固定检索-生成范式,朝向更复杂的代理式多模态检索增强生成(MM-RAG)方向发展。然而,现有基准主要关注简化 QA 且检索链较短,留下了自适应规划和多模态推理的探索不足。我们提出 MC-Search,这是第一个针对代理式 MM-RAG 的基准,包含由五种代表性推理结构构成的长期、逐步标注推理链。每个示例指定子问题、检索模态、支持事实和中间答案,通过 HAVE(逐层归因与证据验证)确保保真度,形成 3,333 个高质量示例,平均 3.7 个推理步。除了答案准确度,MC-Search 引入了用于评估推理质量、逐步检索和规划准确性的过程级指标。通过构建统一的代理式 MM-RAG 管线,我们对六大领先 MLLMs 进行基准测试,揭示了系统性问题,如过度检索和欠检索以及模态错位的规划。最后,我们引入 Search-Align,一个基于验证推理链的过程监督微调框架,表明我们的数据不仅能够实现可靠评估,还能提升开源 MLLMs 中的规划和检索保真度。

关键词

引用

@article{arxiv.2603.00873,
  title  = {MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains},
  author = {Xuying Ning and Dongqi Fu and Tianxin Wei and Mengting Ai and Jiaru Zou and Ting-Wei Li and Hanghang Tong and Yada Zhu and Hendrik Hamann and Jingrui He},
  journal= {arXiv preprint arXiv:2603.00873},
  year   = {2026}
}

备注

ICLR 2026