通用多模态检索的广义对比学习
计算机视觉与模式识别
2025-10-01 v1 机器学习
摘要
尽管交叉模态检索模型(如 CLIP)表现一致,但在检索由图像-文本混合模态组成的关键(例如同时包含图像和文本的维基百科页面)时,性能会显著下降。为此,近期探索了开发统一的单一检索模型,以实现跨不同模态组合的关键检索。常见方法是构建新的构合图像-文本三元组(例如,给定查询图像检索图像-文本对),但该方法需要精心策划数据集以确保质量,且难以推广至未见的模态组合。为克服这些限制,本文提出了广义对比学习(GCL),一种新型损失函数 formulation,通过在 mini-batch 中跨所有模态实施对比学习,利用现有的图像-标题配对数据集来学习统一的表示空间,而无需新的数据集策划。我们通过在 M-BEIR、MMEB 和 CoVR 基准测试上对现有的图像-文本检索模型(如 VISTA、CLIP 和 TinyCLIP)进行实验,证明了 GCL 的有效性,显示出一致的性能提升。
引用
@article{arxiv.2509.25638,
title = {Generalized Contrastive Learning for Universal Multimodal Retrieval},
author = {Jungsoo Lee and Janghoon Cho and Hyojin Park and Munawar Hayat and Kyuwoong Hwang and Fatih Porikli and Sungha Choi},
journal= {arXiv preprint arXiv:2509.25638},
year = {2025}
}
备注
Accepted to NeurIPS 2025