多方言越南语:任务、数据集、基线模型与挑战
计算与语言
2024-10-07 v1
摘要
越南语是一种低资源语言,通常被划分为北部、中部和南部三个主要方言群。然而,每个省份在这些地区都存在独特的发音差异。尽管存在各种语音识别数据集,但均未对63个省份-specific方言进行细粒度分类。为填补这一空白,我们引入越南多方言(ViMD)数据集,一个全面捕捉越南全境63种省份方言的新型数据集。数据集包含102.56小时音频,约19,000句语音,关联转录文本超过120万字。为提供基准并展示数据集的挑战,我们对现有的预训练模型进行微调,以完成两个下游任务:(1)方言识别;(2)语音识别。实证结果表明:地理因素对方言具有显著影响;当前方法在涉及多方言语音数据的语音识别任务中存在局限。该数据集将对研究开放。
引用
@article{arxiv.2410.03458,
title = {Multi-Dialect Vietnamese: Task, Dataset, Baseline Models and Challenges},
author = {Nguyen Van Dinh and Thanh Chi Dang and Luan Thanh Nguyen and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2410.03458},
year = {2024}
}
备注
Main EMNLP 2024