俄语聚焦嵌入模型探索:ruMTEB基准与俄语嵌入模型设计
计算与语言
2025-02-04 v2 人工智能
摘要
嵌入模型在自然语言处理(NLP)中发挥着关键作用,通过创建文本嵌入用于信息检索、评估语义文本相似性等多种任务。本文聚焦于俄语语言领域的嵌入模型研究。我们提出一种新的俄语专注嵌入模型,称为 ru-en-RoSBERTa,并引入俄语版本的 Massive Text Embedding Benchmark(MTEB),即 ruMTEB。基准测试涵盖七类任务,包括语义文本相似性、文本分类、排序和检索等。研究还评估了一批代表性的俄语及多语言模型在所提基准上的表现。结果表明,新模型在俄语任务上的性能与当前最先进模型相当。我们发布模型 ru-en-RoSBERTa,以及伴随开源代码、对原框架的集成以及公开排行榜的 ruMTEB 框架。
引用
@article{arxiv.2408.12503,
title = {The Russian-focused embedders' exploration: ruMTEB benchmark and Russian embedding model design},
author = {Artem Snegirev and Maria Tikhonova and Anna Maksimova and Alena Fenogenova and Alexander Abramov},
journal= {arXiv preprint arXiv:2408.12503},
year = {2025}
}
备注
to appear in NAACL 2025