中文

多方言越南语:任务、数据集、基线模型与挑战

计算与语言 2024-10-07 v1

摘要

越南语是一种低资源语言,通常被划分为北部、中部和南部三个主要方言群。然而,每个省份在这些地区都存在独特的发音差异。尽管存在各种语音识别数据集,但均未对63个省份-specific方言进行细粒度分类。为填补这一空白,我们引入越南多方言(ViMD)数据集,一个全面捕捉越南全境63种省份方言的新型数据集。数据集包含102.56小时音频,约19,000句语音,关联转录文本超过120万字。为提供基准并展示数据集的挑战,我们对现有的预训练模型进行微调,以完成两个下游任务:(1)方言识别;(2)语音识别。实证结果表明:地理因素对方言具有显著影响;当前方法在涉及多方言语音数据的语音识别任务中存在局限。该数据集将对研究开放。

关键词

引用

@article{arxiv.2410.03458,
  title  = {Multi-Dialect Vietnamese: Task, Dataset, Baseline Models and Challenges},
  author = {Nguyen Van Dinh and Thanh Chi Dang and Luan Thanh Nguyen and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2410.03458},
  year   = {2024}
}

备注

Main EMNLP 2024