MMSearch-R1:激励大型多模态模型搜索
计算机视觉与模式识别
2025-06-26 v1 计算与语言
摘要
在现实场景中部署大型多模态模型(LMM)需要访问外部知识源 due to 信息的复杂性和动态性。现有方法如检索增强生成(RAG)和基于提示工程的搜索智能体依赖于僵化的管道,常导致效率低下或过度搜索。我们提出 MMSearch-R1,首个实现化的强化学习框架,使 LMM 能够在真实互联网环境中进行按需、多轮搜索。我们的框架集成了图像和文本搜索工具,使模型能够依据基于结果的奖励(带搜索惩罚)来推理何时以及如何调用它们。为支持训练,我们通过半自动化管道收集多模态搜索 VQA 数据集,涵盖多样化的视觉和文本知识需求,并精选搜索平衡子集,包含 search-required 与 search-free 样本,这对于塑造高效且按需搜索行为至关重要。针对知识密集型和信息寻求 VQA 任务的大量实验表明,我们的模型不仅超过了相同模型规模的 RAG 基线,还在减少搜索调用超过 30% 的同时,匹配了更大 RAG 模型的性能。我们进一步分析了关键经验发现,为推动多模态搜索研究提供了可操作的洞察。
引用
@article{arxiv.2506.20670,
title = {MMSearch-R1: Incentivizing LMMs to Search},
author = {Jinming Wu and Zihao Deng and Wei Li and Yiding Liu and Bo You and Bo Li and Zejun Ma and Ziwei Liu},
journal= {arXiv preprint arXiv:2506.20670},
year = {2025}
}
备注
Code: https://github.com/EvolvingLMMs-Lab/multimodal-search-r1