中文

MTEB-French:用于法语句子嵌入评估与分析的资源

计算与语言 2024-06-18 v2 信息检索 机器学习

摘要

近年来,大量嵌入模型已被公开并广泛用于各种NLP任务。大规模文本嵌入基准(MTEB)主要简化了在英语中为多个任务选择表现良好模型的过程,但扩展到其他语言仍然具有挑战性。为此,我们扩展MTEB,提出了首个大规模法语句子嵌入基准。我们收集了15个现有数据集,提供易于使用的接口,并创建了三个新的法语数据集,用于对8个任务类别进行全局评估。我们大规模比较了51个精心挑选的嵌入模型,进行了全面的统计检验,并分析了模型性能与其众多特征之间的相关性。我们发现,即使没有模型在所有任务上都是最优的,但预训练于句子相似度的大型多语言模型表现异常出色。我们的工作附带开源代码、新数据集和一个公开排行榜。

关键词

引用

@article{arxiv.2405.20468,
  title  = {MTEB-French: Resources for French Sentence Embedding Evaluation and Analysis},
  author = {Mathieu Ciancone and Imene Kerboua and Marion Schaeffer and Wissam Siblini},
  journal= {arXiv preprint arXiv:2405.20468},
  year   = {2024}
}