OpenSearch-VL:面向前沿多模态搜索智能体的开放配方
计算机视觉与模式识别
2026-05-07 v1
摘要
深度搜索已成为前沿多模态智能体的关键能力,使其能够通过主动搜索、证据验证和多步推理来解决复杂问题。尽管取得了快速进展,但顶级多模态搜索智能体仍难以复现,主要由于缺乏开放的高质量训练数据、透明的轨迹合成管道或详细的训练配方。为此,我们引入OpenSearch-VL,这是一个用于训练前沿多模态深度搜索智能体的完全开源配方。首先,我们构建了一个专门的管道来构造高质量训练数据,通过维基百科路径采样、模糊实体重写和源锚视觉对齐,减少捷径和单步检索崩溃。基于此管道,我们策划了两个训练数据集,SearchVL-SFT-36k用于SFT,SearchVL-RL-8k用于RL。此外,我们设计了一个多样化的工具环境,统一文本搜索、图像搜索、OCR、裁剪、锐化、超分辨率和视角校正,使智能体能够结合主动感知与外部知识获取。最后,我们提出一种多回合致命感知GRPO训练算法,通过屏蔽事故后标记来处理连续工具故障,同时通过单向优势夹紧来保留事故前有用的推理。基于此配方,OpenSearch-VL在七个基准测试上实现了超过10分的平均提升,并在多个任务上达到与专有商业模型相当的效果。我们将发布所有数据、代码和模型,以支持多模态深度搜索智能体的开放研究。
引用
@article{arxiv.2605.05185,
title = {OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents},
author = {Shuang Chen and Kaituo Feng and Hangting Chen and Wenxuan Huang and Dasen Dai and Quanxin Shou and Yunlong Lin and Xiangyu Yue and Shenghua Gao and Tianyu Pang},
journal= {arXiv preprint arXiv:2605.05185},
year = {2026}
}
备注
Github Page: https://github.com/shawn0728/OpenSearch-VL