Jasper 与 Stella:SOTA 嵌入模型的蒸馏
信息检索
2025-01-24 v2
摘要
深度学习应用中关键组件之一是稠密检索。在此过程中,嵌入模型将原始文本转换为数值向量。然而,当前在文本嵌入基准(如 Massive Text Embedding Benchmark, MTEB)中表现突出的嵌入模型往往具有大量参数和高向量维度。这给实际应用带来了挑战。为此,我们提出一种新型多阶段蒸馏框架,使较小的学生嵌入模型能够通过三个精心设计的损失函数从多个大型教师嵌入模型中蒸馏。同时,我们利用 Matryoshka Representation Learning (MRL) 有效降低学生嵌入模型的向量维度。我们命名的学生模型 Jasper,基于 Stella 嵌入模型构建,拥有 20 亿参数。在 2024 年 12 月 24 日的 MTEB 排行榜中位列第 3,平均获得 56 个数据集的 71.54 分。我们已在 Hugging Face Hub 上发布模型和数据(https://huggingface.co/infgrad/jasper_en_vision_language_v1)(https://huggingface.co/datasets/infgrad/jasper_text_distill_dataset),训练代码也已开源至项目仓库(https://github.com/NLPJCL/RAG-Retrieval)。
关键词
引用
@article{arxiv.2412.19048,
title = {Jasper and Stella: distillation of SOTA embedding models},
author = {Dun Zhang and Jiacheng Li and Ziyang Zeng and Fulong Wang},
journal= {arXiv preprint arXiv:2412.19048},
year = {2025}
}
备注
7 pages, 1 figure