中文

多语言语音数据集中的数据质量问题:对社会语言学意识和主动语言规划的需求

计算与语言 2025-07-01 v2 人工智能

摘要

我们对三个广泛使用的公共多语言语音数据集——Mozilla Common Voice 17.0、FLEURS和Vox Populi——的质量审计显示,在某些语言中,这些数据集存在显著的质量问题,这可能会在制造成功假象的同时混淆下游评估结果。我们将这些质量问题分为两类:微观层面和宏观层面。我们发现宏观层面的问题在制度化程度较低、通常资源不足的语言中更为普遍。我们提供了一个台湾闽南语(nan_tw)的案例分析,强调了在数据集创建过程中需要主动的语言规划(例如正字法规定、方言边界界定)和增强的数据质量控制。最后,我们提出了指导方针和建议,以减轻未来数据集开发中的这些问题,强调了社会语言学意识和语言规划原则的重要性。此外,我们鼓励研究如何将这一创建过程本身用作社区主导的语言规划和复兴的工具。

关键词

引用

@article{arxiv.2506.17525,
  title  = {Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language Planning},
  author = {Mingfei Lau and Qian Chen and Yeming Fang and Tingting Xu and Tongzhou Chen and Pavel Golik},
  journal= {arXiv preprint arXiv:2506.17525},
  year   = {2025}
}

备注

Accepted by ACL 2025 Main Conference