中文

波兰语大型文本嵌入基准 PL-MTEB

计算与语言 2026-04-27 v2

摘要

本文介绍了波兰语大型文本嵌入基准 (PL-MTEB),这是用于波兰语文本嵌入的综合性基准测试。PL-MTEB 包含 30 个跨越五个类别的多样化 NLP 任务:分类、聚类、对分类、信息检索和语义文本相似度。在本工作范围内,我们在 MTEB 基础上新增了 12 个波兰语任务,并准备了两个新数据集用于创建四个聚类任务。我们评估了 30 个公开可用的文本嵌入模型,包括波兰语模型和多语言模型。我们对特定任务类型和模型规模的结果进行了详细分析。我们将所准备的数据集、评估源码以及获取的结果均公开于 https://github.com/rafalposwiata/pl-mteb。

关键词

引用

@article{arxiv.2405.10138,
  title  = {PL-MTEB: Polish Massive Text Embedding Benchmark},
  author = {Rafał Poświata and Sławomir Dadas and Michał Perełkiewicz},
  journal= {arXiv preprint arXiv:2405.10138},
  year   = {2026}
}

备注

Accepted for ACL 2026 Findings