中文

jina-embeddings-v4:多模态多语言检索的通用嵌入

人工智能 2025-07-08 v3 计算与语言 信息检索

摘要

我们介绍jina-embeddings-v4,一个拥有38亿参数的多模态嵌入模型,通过一种新型架构统一文本和图像表示,支持单向量和多向量嵌入采用late interaction风格。该模型集成了任务特定的低秩适应(LoRA)适配器,以优化跨多样化检索场景的性能,包括查询-文档检索、语义文本相似性和代码搜索。全面评估表明,jina-embeddings-v4在单模态和跨模态检索任务上均实现了最先进的性能,尤其擅长处理视觉丰富内容,如表格、图表、图示和混合媒介格式。为促进对这一能力的评估,我们还引入了Jina-VDR,这是一个专为视觉丰富图像检索设计的新基准。

关键词

引用

@article{arxiv.2506.18902,
  title  = {jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval},
  author = {Michael Günther and Saba Sturua and Mohammad Kalim Akram and Isabelle Mohr and Andrei Ungureanu and Bo Wang and Sedigheh Eslami and Scott Martens and Maximilian Werk and Nan Wang and Han Xiao},
  journal= {arXiv preprint arXiv:2506.18902},
  year   = {2025}
}

备注

22 pages, 1-10 main, 14-22 experimental results, benchmark tables