生成型巨头 vs 检索弱者:为何多模态大语言模型在多模态检索任务中表现不佳?
计算机视觉与模式识别
2026-05-12 v2
摘要
尽管多模态大语言模型(MLLM)在生成任务中取得了显著成功,我们注意到它们在零样本多模态检索任务中表现出与预期相反的缺陷。本文研究阻止 MLLM 成为有效检索器的底层机制。借助稀疏自编码器(SAE),我们分解 MLLM 输出表示以探测其可解释语义概念,揭示其内在行为。我们的分析表明,MLLM 的表示空间被文本语义主导;而对于多模态检索至关重要的视觉语义仅占很小比例。我们发现,这一不平衡因 MLLM 严重聚焦于桥接图像-文本模态而加剧,这有利于生成但导致嵌入均匀化,最终削弱了多模态检索所需的判别性。我们进一步发现,MLLM 在相似性计算中贡献最大的特定特征组件实际上是干扰因素,显著降低检索性能。基于这些发现,我们提出 ReAlign,一种测试时适应方法,通过施加白化变换调整 MLLM 表示空间的几何结构。实证结果表明,这一简单干预在无需微调的情况下,能持续提升跨 diverse MLLM 的零样本多模态检索性能。代码已公开于 https://github.com/Heinz217/mllm-retrieval-analysis。
引用
@article{arxiv.2512.19115,
title = {Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?},
author = {Hengyi Feng and Zeang Sheng and Meiyi Qiang and Yang Li and Wentao Zhang},
journal= {arXiv preprint arXiv:2512.19115},
year = {2026}
}