InterLV-Search: 基准测试交错多模态智能体搜索
计算机视觉与模式识别
2026-05-11 v1 计算与语言
信息检索
摘要
现有的多模态智能体搜索基准评估了多模态搜索和视觉浏览,但视觉证据要么局限于输入,要么被视为答案终点,而不是交错搜索轨迹的一部分。我们引入了\textbf{InterLV-Search},一个用于交错语言-视觉智能体搜索的基准,其中文本和视觉证据被反复用于调节后续搜索。它包含三个级别的2,061个样本:主动视觉证据寻求、受控离线交错多模态搜索和开放网络交错多模态搜索。除了现有基准之外,它还包括多模态多分支样本,这些样本涉及在证据搜索过程中对多个实体进行比较。我们使用自动化流水线构建了级别1和级别2,并使用机器主导、人工监督的开放网络流水线构建了级别3。我们进一步提供了InterLV-Agent,用于标准化工具使用、轨迹记录和评估。在专有和开源多模态智能体上的实验表明,当前系统远未解决交错多模态搜索问题,最佳模型的总体准确率低于50%,凸显了在视觉证据寻求、搜索控制和多模态证据整合方面的挑战。我们在https://github.com/hbhalpha/InterLV-Search-Bench发布基准数据和评估代码。
引用
@article{arxiv.2605.07510,
title = {InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search},
author = {Bohan Hou and Jiuning Gu and Jiayan Guo and Ronghao Dang and Sicong Leng and Xin Li and Xuemeng Song and Jianfei Yang},
journal= {arXiv preprint arXiv:2605.07510},
year = {2026}
}