中文

VSeacher:通过强化学习实现长期跨模态搜索代理

计算机视觉与模式识别 2026-03-09 v2

摘要

大型模型正越来越多地成为能够与真实环境交互并使用外部工具来增强其静态能力的自主代理。然而,最近的进展主要集中在文本-only大语言模型方面,这些模型仅限于单一模态,因而具有较窄的应用场景。另一方面,虽然多模态大模型提供了更强的感知能力,但仍局限于静态知识,缺乏访问和利用最新网络信息的能力。在本文中,我们提出VSeacher,将静态多模态模型转化为能够在真实网络环境中进行长期、多轮工具使用的多模态搜索代理,包括文本搜索、图像搜索和网页浏览,通过强化学习实现。具体而言,我们引入迭代注入数据合成管道,以生成大规模、复杂的多模态QA问题,并通过全面指标进行筛选,以确保高质量和足够的难度。我们随后采用SFT-then-RL训练管道,将基础多模态模型转化为能够在真实网络环境中进行多轮工具调用的代理。此外,我们提出了一个专用于评估多模态搜索代理搜索能力的多模态搜索基准MM-SearchExam,证明对最近专有模型具有高度挑战性。广泛的评估显示我们方法的有效性。VSeacher在多模态搜索基准上取得优异性能,甚至在多模态网页搜索任务中超越了几个专有模型。

关键词

引用

@article{arxiv.2603.02795,
  title  = {VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning},
  author = {Ruiyang Zhang and Qianguo Sun and Chao Song and Yiyan Qi and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2603.02795},
  year   = {2026}
}

备注

23 pages, 6 figures