DIALECTBENCH:面向方言、变体与近缘语言的自然语言处理基准
计算与语言
2024-07-09 v2 人工智能
摘要
语言技术应根据其在真实用例中的有效性来评判。自然语言处理(NLP)研究与评估中常被忽视的一个方面是语言变异,表现为非标准方言或语言变体(以下简称变体)。大多数 NLP 基准仅限于标准语言变体。为填补这一空白,我们提出 DIALECTBENCH,这是首个面向变体的大规模 NLP 基准,汇集了广泛的任务多样的变体数据集(涵盖 281 种变体的 10 项文本级任务)。这允许对不同语言变体的 NLP 系统性能进行全面评估。我们提供了标准与非标准语言变体间性能差异的实质性证据,并识别了跨任务存在大性能差异的语言聚类。我们相信 DIALECTBENCH 为语言变体 NLP 的现状提供了全面视角,并朝着进一步推进其发展迈出了一步。代码/数据:https://github.com/ffaisal93/DialectBench
引用
@article{arxiv.2403.11009,
title = {DIALECTBENCH: A NLP Benchmark for Dialects, Varieties, and Closely-Related Languages},
author = {Fahim Faisal and Orevaoghene Ahia and Aarohi Srivastava and Kabir Ahuja and David Chiang and Yulia Tsvetkov and Antonios Anastasopoulos},
journal= {arXiv preprint arXiv:2403.11009},
year = {2024}
}
备注
Equal contribution: Fahim Faisal, Orevaoghene Ahia