中文

FreeRet:无需训练的 MLLMs 作为检索器

计算机视觉与模式识别 2026-05-26 v3

摘要

多模态大语言模型(MLLMs)正在成为混合模态检索的通用基础,但它们通常需要大量后处理训练才能转换为检索用的对比编码器。本工作询问:无需额外训练的即插即用 MLLMs 能否成为强大的检索器?我们提出了 FreeRet,一个即插即用的框架,将任何 MLLM 转换为两个阶段的检索器。FreeRet 首先直接从模型中派生语义相关嵌入以进行快速候选搜索,然后利用其推理能力进行精确重排。该框架贡献了三项创新:绕过词汇对齐层以获得语义忠实的嵌入、以显式先验条件表示生成、以及通过中性选择框架化来缓解重排中的框架效应。在覆盖 46 个数据集的 MMEB 和 MMEB-V2基准测试上,FreeRet 在无数对上训练的模型之上显著优于它们。除了基准测试之外,FreeRet 是模型无关的,并且能在 MLLM 系列和规模之间无缝扩展,保留其生成能力,支持任意模态组合,并将检索、重排和生成统一整合到单个模型中的端到端 RAG 中。我们的发现表明,在恰当地利用下,预训练 MLLMs 可以作为强大的检索引擎,无需训练即可发挥作用,弥合了其作为通用型模型角色的关键差距。

关键词

引用

@article{arxiv.2509.24621,
  title  = {FreeRet: MLLMs as Training-Free Retrievers},
  author = {Yuhan Zhu and Xiangyu Zeng and Chenting Wang and Xinhao Li and Chunxu Liu and Yicheng Xu and Ziang Yan and Yi Wang and Limin Wang},
  journal= {arXiv preprint arXiv:2509.24621},
  year   = {2026}
}

备注

ICML 2026