中文

面向大规模图像检索的多模态语言模型索引

计算机视觉与模式识别 2026-04-16 v1 计算与语言 信息检索

摘要

多模态大语言模型(MLLMs)已展现出强大的跨模态推理能力,但其在纯视觉任务中的潜力仍未得到充分探索。我们研究将 MLLMs 作为无需训练的相似度估计器,用于实例级图像到图像的检索。我们的方法通过成对图像提示模型,并将下一个词元的概率转换为相似度分数,从而在大规模检索流程中实现零样本重排序。这种设计避免了专门的架构和微调,利用了在多模态预训练中学到的丰富视觉判别能力。我们通过将 MLLMs 与内存高效的索引和 top-kk 候选重排序相结合来解决可扩展性问题。跨多个基准的实验表明,MLLMs 在其原生领域之外的表现优于特定任务的重排序器,并且对杂乱、遮挡和小物体展现出卓越的鲁棒性。尽管结果强劲,我们仍识别出在严重外观变化下的失败模式,这突显了未来研究的机会。我们的发现将 MLLMs 定位为开放世界大规模图像检索的一个有前景的替代方案。

关键词

引用

@article{arxiv.2604.13268,
  title  = {Indexing Multimodal Language Models for Large-scale Image Retrieval},
  author = {Bahey Tharwat and Giorgos Kordopatis-Zilos and Pavel Suma and Ian Reid and Giorgos Tolias},
  journal= {arXiv preprint arXiv:2604.13268},
  year   = {2026}
}