MM-Embed:基于多模态大语言模型的通用多模态检索
计算与语言
2025-02-25 v2 人工智能
计算机视觉与模式识别
信息检索
机器学习
摘要
最先进的检索模型通常处理简单的搜索场景,其中检索任务是固定的(例如,为特定问题查找段落),且查询和检索结果仅支持单一模态。本文介绍了推进多模态大语言模型(MLLM)信息检索的技术,实现了一种更广泛的搜索场景,称为通用多模态检索,其中容纳了多种模态和多样化的检索任务。为此,我们首先研究在 10 个数据集和 16 个检索任务上对 MLLM 进行微调作为双编码器检索器。我们的实证结果表明,微调后的 MLLM 检索器能够理解由文本和图像组成的复杂查询,但由于 MLLM 表现出的模态偏差,其在跨模态检索任务中表现不如较小的 CLIP 检索器。为解决此问题,我们提出模态感知的难负例挖掘以缓解 MLLM 检索器表现出的模态偏差。其次,我们提出对通用多模态检索器进行持续微调,以增强其文本检索能力同时保持多模态检索能力。因此,我们的模型 MM-Embed 在涵盖多个领域和任务的多模态检索基准 M-BEIR 上取得了最先进性能,同时在 MTEB 检索基准上也超越了最先进的文本检索模型 NV-Embed-v1。我们还探索将现成的 MLLM 作为零样本重排序器来优化多模态检索器候选结果的排序。我们发现,通过提示与重排序,当用户查询(例如由文本和图像组成的查询)更复杂且更难理解时,MLLM 可以进一步提升多模态检索。这些发现也为未来推进通用多模态检索铺平了道路。
引用
@article{arxiv.2411.02571,
title = {MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs},
author = {Sheng-Chieh Lin and Chankyu Lee and Mohammad Shoeybi and Jimmy Lin and Bryan Catanzaro and Wei Ping},
journal= {arXiv preprint arXiv:2411.02571},
year = {2025}
}
备注
Accepted at ICLR 2025. We release the model weights at: https://huggingface.co/nvidia/MM-Embed