MRMR:一个面向推理密集型多模态检索的真实专家级多学科基准
信息检索
2026-02-17 v2
摘要
我们提出了MRMR,这是首个要求进行密集推理的专家级多学科多模态检索基准。MRMR包含1502个查询,涵盖23个领域,正样本文档经过人工专家仔细验证。与先前的基准相比,MRMR引入了三项关键进展。第一,它挑战检索系统在多个专业领域的表现,实现跨领域的细粒度模型比较。第二,查询是推理密集型的,图像需要更深入的解读,例如诊断显微切片。我们进一步引入了矛盾检索(Contradiction Retrieval),这是一种要求模型识别冲突概念的新任务。最后,查询和文档被构建为图像-文本交错序列。与早期仅限于单张图像或单模态文档的基准不同,MRMR提供了一个真实的环境,包含多图像查询和混合模态语料库文档。我们对四类多模态检索系统和14个前沿模型在MRMR上进行了广泛评估。文本嵌入模型Qwen3-Embedding配合LLM生成的图像标题取得了最高性能,表明多模态检索模型仍有巨大的改进空间。尽管最新的多模态模型如Ops-MM-Embedding在专家领域查询上表现具有竞争力,但它们在推理密集型任务上仍有不足。我们相信MRMR为在更真实和更具挑战性的场景中推进多模态检索铺平了道路。
引用
@article{arxiv.2510.09510,
title = {MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval},
author = {Siyue Zhang and Yuan Gao and Xiao Zhou and Yilun Zhao and Tingyu Song and Arman Cohan and Anh Tuan Luu and Chen Zhao},
journal= {arXiv preprint arXiv:2510.09510},
year = {2026}
}