中文

波斯语大规模文本嵌入基准

计算与语言 2025-05-20 v2 信息检索 机器学习

摘要

本文介绍了基于Massive Text Embedding Benchmark (MTEB)构建的波斯语(Farsi)文本嵌入综合基准。该基准包含63个数据集,涵盖七个不同任务:分类、聚类、对分类、排序、检索、摘要检索和语义文本相似度。数据集由现有数据、翻译数据和新生成数据混合组成,提供了多样化的评估框架,用于评估波斯语语言模型。鉴于文本嵌入模型在聊天机器人中的应用日益增长,评估数据集已成为聊天机器人挑战和检索增强生成系统中不可或缺的要素。作为本文的贡献,我们首次将聊天机器人评估数据集纳入MTEB基准。此外,本文引入了全新的摘要检索任务,该任务不属于标准MTEB所包含的任务。本文还引入了大量新的波斯语语言NLP数据集,用于训练和评估,其中一些数据集在波斯语中尚无先前对应版本。我们评估了多个波斯语和多语言嵌入模型在各种任务上的表现。该工作引入了开源基准,包含数据集、代码及公开排行榜。

关键词

引用

@article{arxiv.2502.11571,
  title  = {FaMTEB: Massive Text Embedding Benchmark in Persian Language},
  author = {Erfan Zinvandi and Morteza Alikhani and Mehran Sarmadi and Zahra Pourbahman and Sepehr Arvin and Reza Kazemi and Arash Amini},
  journal= {arXiv preprint arXiv:2502.11571},
  year   = {2025}
}