jina-embeddings-v3:结合任务 LoRA 的多语言嵌入
计算与语言
2024-09-20 v3 人工智能
信息检索
摘要
我们推出了 jina-embeddings-v3,一种具有 5.7 亿参数的新型文本嵌入模型,在多语言数据与长上下文检索任务上达到了 SOTA 性能,支持高达 8192 tokens 的上下文长度。该模型包含一组任务特定的低秩自适应(LoRA)适配器,用于为查询-文档检索、聚类、分类与文本匹配生成高质量嵌入。在 MTEB 基准上的评估表明,jina-embeddings-v3 在英语任务上优于 OpenAI 和 Cohere 的最新专有嵌入,并在所有多语言任务上优于 multilingual-e5-large-instruct。在默认输出维度为 1024 的情况下,用户可借助 Matryoshka 表示学习将嵌入维度灵活缩减至最低 32,且不损失性能。
引用
@article{arxiv.2409.10173,
title = {jina-embeddings-v3: Multilingual Embeddings With Task LoRA},
author = {Saba Sturua and Isabelle Mohr and Mohammad Kalim Akram and Michael Günther and Bo Wang and Markus Krimmel and Feng Wang and Georgios Mastrapas and Andreas Koukounas and Nan Wang and Han Xiao},
journal= {arXiv preprint arXiv:2409.10173},
year = {2024}
}
备注
20 pages, pp11-13 references, pp14-20 appendix and experiment tables