Jina CLIP:您的 CLIP 模型即是文本检索器
计算与语言
2024-06-27 v2 人工智能
计算机视觉与模式识别
信息检索
摘要
对比式语言-图像预训练 (CLIP) 广泛用于训练模型,将图像和文本映射到固定大小的向量空间,以实现对齐。这些模型是多模态信息检索和相关任务的关键。然而,CLIP 模型在文本-only 任务上的表现通常不如专门的文本模型。这会导致信息检索系统需要维护用于文本-only 和多模态任务的独立嵌入和模型,从而产生效率低下。我们提出一种新型的多任务对比式训练方法,以解决此问题。我们使用该方法训练 jina-clip-v1 模型,在文本-图像和文本-文本检索任务上实现最先进的性能。
引用
@article{arxiv.2405.20204,
title = {Jina CLIP: Your CLIP Model Is Also Your Text Retriever},
author = {Andreas Koukounas and Georgios Mastrapas and Michael Günther and Bo Wang and Scott Martens and Isabelle Mohr and Saba Sturua and Mohammad Kalim Akram and Joan Fontanals Martínez and Saahil Ognawala and Susana Guzman and Maximilian Werk and Nan Wang and Han Xiao},
journal= {arXiv preprint arXiv:2405.20204},
year = {2024}
}
备注
4 pages, MFM-EAI@ICML2024