面向检索的小型多语言模型后接
计算与语言
2026-04-23 v2
摘要
训练高效的多语言嵌入模型面临独特挑战,因语言和任务目标的多样性。虽然小型多语言模型(<10亿参数)在多语言任务中表现良好,但在最常见的用例——检索方面始终落后于大型模型(>10亿参数)。这引出一个关键问题:是否可以对小型模型进行后接,以专为检索任务优化其性能?本文研究影响多语言嵌入效果的关键因素,重点关注训练数据规模、负采样策略和数据多样性。我们发现,尽管增加训练数据规模可带来初始性能提升,但这些改进很快出现平台期——表明存在报酬递减。纳入硬性负样本对于持续提升检索准确率至关重要。此外,我们的分析表明,训练数据中的任务多样性对性能的贡献远超语言多样性。结果,我们开发了一个紧凑型(约3亿参数)多语言模型,实现检索性能与甚至超越当前强大的70亿参数模型相当。
引用
@article{arxiv.2510.14274,
title = {Retrofitting Small Multilingual Models for Retrieval: Matching 7B Performance with 300M Parameters},
author = {Lifu Tu and Yingbo Zhou and Semih Yavuz},
journal= {arXiv preprint arXiv:2510.14274},
year = {2026}
}
备注
minor update from previous version