中文

MMSearch: 作为多模态搜索引擎的大模型潜力基准测试

计算机视觉与模式识别 2024-11-28 v2 人工智能 计算与语言 信息检索

摘要

大语言模型 (LLM) 的出现为 AI 搜索引擎如 SearchGPT 带来了新的人机-互联网交互范式。然而,大多数当前 AI 搜索引擎仅限于文本模式,忽略了多模态用户查询以及网页信息中文本-图像交叉排列的特性。近期,大型多模态模型 (LMM) 取得了显著进展。然而,LMM 能否作为 AI 搜索引擎使用尚未得到充分探索,留下了 LMM 在多模态搜索中的潜力未被充分发掘的开放问题。为此,我们首先设计了精细的管道 MMSearch-Engine,赋予任何 LMM 多模态搜索能力。此后,我们引入 MMSearch,一个全面的评估基准,用于评估 LMM 的多模态搜索性能。精选数据集包含 300 个人工收集的实例,覆盖 14 个子领域,且与当前 LMM 训练数据无交叉,确保正确答案只能通过搜索获得。通过 MMSearch-Engine,对 LMM 进行三个单独任务(requery、rerank 和 summarization)以及一个具有完整搜索流程的具挑战性的端到端任务进行评估。我们在封闭源和开源 LMM 上进行了大量实验。在所有测试模型中,GPT-4o 配合 MMSearch-Engine 取得最佳成绩,甚至在端到端任务中超越了商业产品 Perplexity Pro,证明了我们提出方法的有效性。我们进一步提出错误分析,揭示当前 LMM 仍难以完全把握多模态搜索任务,并进行消融研究,表明放大推理计算量为 AI 搜索引擎的潜力。我们希望 MMSearch 为指导未来多模态 AI 搜索引擎的发展提供独特见解。项目页面: https://mmsearch.github.io

关键词

引用

@article{arxiv.2409.12959,
  title  = {MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines},
  author = {Dongzhi Jiang and Renrui Zhang and Ziyu Guo and Yanmin Wu and Jiayi Lei and Pengshuo Qiu and Pan Lu and Zehui Chen and Chaoyou Fu and Guanglu Song and Peng Gao and Yu Liu and Chunyuan Li and Hongsheng Li},
  journal= {arXiv preprint arXiv:2409.12959},
  year   = {2024}
}

备注

Project Page: https://mmsearch.github.io