jina-clip-v2:用于文本和图像的多语言多模态嵌入
计算与语言
2025-04-25 v2 计算机视觉与模式识别
信息检索
摘要
对比式语言-图像预训练 (CLIP) 已在跨模态信息检索和多模态理解任务中广泛应用。然而,CLIP 模型主要针对跨模态视觉-语言任务进行优化,在单模态文本任务上表现不佳。此外,这些模型通常在英语数据集上训练,因而缺乏多语言理解能力。从视觉理解角度看,之前的 CLIP-based 模型在视觉丰富文档上的理解能力有限。本文提出了 jina-clip-v2,一款通过多任务和多阶段对比学习范式,在文本配对、三元组和图像-文本配对上进行训练,以支持文本-only 和跨模态任务。我们采用多语言文本编码器,并将训练数据集扩展到包括 29 种非英语语言(包括印地语、中文、德语、法语等),以及视觉丰富文档的图像。我们评估了模型性能,表明 jina-clip-v2 在零样本文本-only 检索、语义文本相似度和跨模态检索任务中,在英语和多语言环境下均优于最先进的 CLIP-based 模型。jina-clip-v2 还提供了嵌入维度的灵活性,使用户可选择表示的粒度。jina-clip-v2 已公开提供,地址为 https://huggingface.co/jinaai/jina-clip-v2。
引用
@article{arxiv.2412.08802,
title = {jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images},
author = {Andreas Koukounas and Georgios Mastrapas and Sedigheh Eslami and Bo Wang and Mohammad Kalim Akram and Michael Günther and Isabelle Mohr and Saba Sturua and Nan Wang and Han Xiao},
journal= {arXiv preprint arXiv:2412.08802},
year = {2025}
}
备注
30 pages, 1-10 main paper, 10-12 refs, 12-30 benchmarks