jina-embeddings-v5-omni:通过锁定对齐塔实现几何保真嵌入
计算与语言
2026-05-13 v2
摘要
本文介绍了 GELATO(Geometry-preserving Embeddings via Locked Aligned TOwers),一种新的多模态嵌入模型方法。我们基于 VLM 风格的架构,其中非文本编码器被适配以生成语言模型的输入,后者随后为所有输入类型生成嵌入。我们呈现的结果是:jina-embeddings-v5-omni 套件,包含一对模型,可将文本、图像、音频和视频输入编码到单个语义嵌入空间中。GELATO 将两个 Jina Embeddings v5 文本模型扩展为支持额外模态,通过添加用于图像和音频的编码器。 backbone 文本嵌入模型和添加的非文本模态编码器保持冻结状态。我们仅训练连接组件,代表联合模型总体权重的 0.35%。因此,训练远比完整参数重新训练更高效。此外,语言模型保持基本不变,对于文本输入恰好产生与 Jina Embeddings v5 文本模型相同的嵌入。我们的评估显示,GELATO 的结果在与最先进的多模态嵌入模型相当,几乎等同于更大规模模型的性能。
关键词
引用
@article{arxiv.2605.08384,
title = {jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers},
author = {Florian Hönicke and Michael Günther and Andreas Koukounas and Mohammad Kalim Akram and Scott Martens and Saba Sturua and Han Xiao},
journal= {arXiv preprint arXiv:2605.08384},
year = {2026}
}
备注
18 pages, 8 figures, 10 tables