DeepMMSearch-R1:多模态 LLM 在多模态网页搜索中的应用
计算机视觉与模式识别
2025-10-15 v1 信息检索
摘要
在实际应用中,多模态大语言模型 (MLLM) 需要访问外部知识源,并且必须保持对动态且不断变化的真实世界信息的响应能力,以便解决信息寻求和知识密集型用户查询。现有方法,如检索增强生成 (RAG) 方法、搜索智能体和配备搜索功能的 MLLM,常常 suffer于管线僵化、搜索调用过度以及搜索查询构建不当,导致效率低下和结果次优。为此,我们提出了 DeepMMSearch-R1,首个能够按需进行多轮网页搜索并动态为图像和文本搜索工具构思查询的多模态 LLM。具体而言,DeepMMSearch-R1 可以基于输入图像的相关裁剪区域发起网页搜索,从而使图像搜索更为有效,并且可以根据检索到的信息迭代调整文本搜索查询,从而实现自我反思和自我纠正。我们的方法依赖于两个阶段的训练流程:冷启动监督微调阶段 followed by 在线强化学习优化。对于训练,我们引入了 DeepMMSearchVQA,这是一个通过自动化流程结合网页搜索工具获取的真实世界信息创建的新型多模态 VQA 数据集。该数据集包含多样化的、多跳查询,这些查询整合了文本和视觉信息,教导模型何时搜索、搜索什么、使用哪种搜索工具以及如何对检索到的信息进行推理。我们在广泛的知识密集型基准测试上进行了大量实验,证明了我们方法的优越性。最后,我们分析了结果并提供了对于推动多模态网页搜索有价值的见解。
引用
@article{arxiv.2510.12801,
title = {DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search},
author = {Kartik Narayan and Yang Xu and Tian Cao and Kavya Nerella and Vishal M. Patel and Navid Shiee and Peter Grasch and Chao Jia and Yinfei Yang and Zhe Gan},
journal= {arXiv preprint arXiv:2510.12801},
year = {2025}
}