中文

量化跨语言方言差距及其相关因素

计算与语言 2023-10-24 v1 机器学习

摘要

历史上,研究人员和用户都注意到将NLP工具应用于语言的少数变体(如波多黎各西班牙语或瑞士德语)时质量会下降,但探讨此现象的研究仅限于少数几种语言。此外,过去的研究主要在单语环境下进行,因此尚未识别出跨语言趋势并将其与外部因素联系起来。在这项工作中,我们对最具影响力、最先进的大语言模型(LLMs)在两个高频应用——机器翻译和自动语音识别——上进行了全面评估,以考察它们在多种高资源与低资源语言的地区方言上的表现。此外,我们分析了地区方言差距如何与经济、社会和语言因素相关联。训练数据的影响(包括数据集规模及其构建过程等相关因素)被证明是显著的,但在不同模型或语言间并不一致,这意味着在解决方言差距时不能采取一刀切的方法。本工作将通过揭示明显的不平等并识别通过审慎数据收集加以应对的可能路径,为推进方言NLP领域奠定基础。

关键词

引用

@article{arxiv.2310.15135,
  title  = {Quantifying the Dialect Gap and its Correlates Across Languages},
  author = {Anjali Kantharuban and Ivan Vulić and Anna Korhonen},
  journal= {arXiv preprint arXiv:2310.15135},
  year   = {2023}
}

备注

Accepted to EMNLP Findings 2023