中文

粤语自动语音识别数据集:综述与新数据集

计算与语言 2022-01-19 v2 声音 音频与语音处理

摘要

低资源语言的自动语音识别(ASR)改善了语言少数群体对人工智能(AI)所提供的技术优势的获取。在本文中,我们通过创建一个全新的粤语数据集来解决香港粤语数据稀缺的问题。我们的数据集,多领域粤语语料库(MDCC),包含73.6小时的干净朗读语音及对应文本,采集自香港的粤语有声书。它涵盖哲学、政治、教育、文化、生活方式与家庭等领域,涉及广泛的话题。我们还回顾了所有现有的粤语数据集,并根据其语音类型、数据来源、总规模与可用性进行分析。我们进一步在最大的现有数据集 Common Voice zh-HK 和我们提出的 MDCC 上使用最先进的 ASR 模型 Fairseq S2T Transformer 进行实验,结果展示了我们数据集的有效性。此外,我们通过在 MDCC 与 Common Voice zh-HK 上应用多数据集学习,创建了一个强大且鲁棒的粤语 ASR 模型。

关键词

引用

@article{arxiv.2201.02419,
  title  = {Automatic Speech Recognition Datasets in Cantonese: A Survey and New Dataset},
  author = {Tiezheng Yu and Rita Frieske and Peng Xu and Samuel Cahyawijaya and Cheuk Tung Shadow Yiu and Holy Lovenia and Wenliang Dai and Elham J. Barezi and Qifeng Chen and Xiaojuan Ma and Bertram E. Shi and Pascale Fung},
  journal= {arXiv preprint arXiv:2201.02419},
  year   = {2022}
}