中文

jina-clip-v2:用于文本和图像的多语言多模态嵌入

计算与语言 2025-04-25 v2 计算机视觉与模式识别 信息检索

摘要

对比式语言-图像预训练 (CLIP) 已在跨模态信息检索和多模态理解任务中广泛应用。然而,CLIP 模型主要针对跨模态视觉-语言任务进行优化,在单模态文本任务上表现不佳。此外,这些模型通常在英语数据集上训练,因而缺乏多语言理解能力。从视觉理解角度看,之前的 CLIP-based 模型在视觉丰富文档上的理解能力有限。本文提出了 jina-clip-v2,一款通过多任务和多阶段对比学习范式,在文本配对、三元组和图像-文本配对上进行训练,以支持文本-only 和跨模态任务。我们采用多语言文本编码器,并将训练数据集扩展到包括 29 种非英语语言(包括印地语、中文、德语、法语等),以及视觉丰富文档的图像。我们评估了模型性能,表明 jina-clip-v2 在零样本文本-only 检索、语义文本相似度和跨模态检索任务中,在英语和多语言环境下均优于最先进的 CLIP-based 模型。jina-clip-v2 还提供了嵌入维度的灵活性,使用户可选择表示的粒度。jina-clip-v2 已公开提供,地址为 https://huggingface.co/jinaai/jina-clip-v2。

关键词

引用

@article{arxiv.2412.08802,
  title  = {jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images},
  author = {Andreas Koukounas and Georgios Mastrapas and Sedigheh Eslami and Bo Wang and Mohammad Kalim Akram and Michael Günther and Isabelle Mohr and Saba Sturua and Nan Wang and Han Xiao},
  journal= {arXiv preprint arXiv:2412.08802},
  year   = {2025}
}

备注

30 pages, 1-10 main paper, 10-12 refs, 12-30 benchmarks