中文

俄语聚焦嵌入模型探索:ruMTEB基准与俄语嵌入模型设计

计算与语言 2025-02-04 v2 人工智能

摘要

嵌入模型在自然语言处理(NLP)中发挥着关键作用,通过创建文本嵌入用于信息检索、评估语义文本相似性等多种任务。本文聚焦于俄语语言领域的嵌入模型研究。我们提出一种新的俄语专注嵌入模型,称为 ru-en-RoSBERTa,并引入俄语版本的 Massive Text Embedding Benchmark(MTEB),即 ruMTEB。基准测试涵盖七类任务,包括语义文本相似性、文本分类、排序和检索等。研究还评估了一批代表性的俄语及多语言模型在所提基准上的表现。结果表明,新模型在俄语任务上的性能与当前最先进模型相当。我们发布模型 ru-en-RoSBERTa,以及伴随开源代码、对原框架的集成以及公开排行榜的 ruMTEB 框架。

关键词

引用

@article{arxiv.2408.12503,
  title  = {The Russian-focused embedders' exploration: ruMTEB benchmark and Russian embedding model design},
  author = {Artem Snegirev and Maria Tikhonova and Anna Maksimova and Alena Fenogenova and Alexander Abramov},
  journal= {arXiv preprint arXiv:2408.12503},
  year   = {2025}
}

备注

to appear in NAACL 2025