中文

一种用于多语言 NLP 数据集中语言多样性透明比较的度量方法

计算与语言 2024-04-17 v2

摘要

类型学多样化的基准测试正被越来越多地创建,以追踪多语言 NLP 取得的进展。这些数据集的语言多样性通常以样本中包含的语言数量或语系数量来衡量,但此类度量并未考虑所包含语言的结构属性。在本文中,我们提出将数据集的语言多样性与参考语言样本进行评估,作为一种长期最大化语言多样性的手段。我们将语言表示为特征集,并应用适用于比较度量集的 Jaccard 指数版本。除了从类型学数据库中提取的特征外,我们还提出了一种自动化的基于文本的度量方法,可用作克服手动收集特征中众所周知的数据稀疏问题的手段。我们的多样性得分在语言特征方面具有可解释性,并能识别数据集中未代表的语言类型。利用我们的方法,我们分析了一系列流行的多语言数据集(UD、Bible100、mBERT、XTREME、XGLUE、XNLI、XCOPA、TyDiQA、XQuAD)。除了对这些数据集进行排名外,我们还发现,例如,几乎所有数据集中都缺少(多)综合语 (poly/synthetic languages)。

关键词

引用

@article{arxiv.2403.03909,
  title  = {A Measure for Transparent Comparison of Linguistic Diversity in Multilingual NLP Data Sets},
  author = {Tanja Samardzic and Ximena Gutierrez and Christian Bentz and Steven Moran and Olga Pelloni},
  journal= {arXiv preprint arXiv:2403.03909},
  year   = {2024}
}

备注

Accepted to NAACL 2024 Findings