中文

基于弱监督音素的低资源Iu Mien语言语音识别

声音 2024-09-17 v2 计算与语言 音频与语音处理

摘要

主流自动语音识别(ASR)技术通常需要数百至数千小时的标注语音数据。三种低资源ASR方法包括基于音素或子词的监督预训练,以及在多语言数据上的自监督预训练。Iu Mien语言是中国 Yao 族的主要民族语言,在标注语音数据极其有限的情况下属于低资源语言。本文在不足10小时的标注Iu Mien语言语音数据下,研究并比较了这三种方法。我们的实验基于最近发布的三个基于CommonVoice数据集中10种语言预训练的三种主干模型(CV-Lang10),分别对应低资源ASR的三种方法。发现音素监督方法在数据效率方面优于子词监督和自监督方法,特别是通过弱监督音素-based 多语言预训练获得的Whistle模型取得最具竞争力的效果。

关键词

引用

@article{arxiv.2407.13292,
  title  = {Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training},
  author = {Lukuan Dong and Donghong Qin and Fengbo Bai and Fanhua Song and Yan Liu and Chen Xu and Zhijian Ou},
  journal= {arXiv preprint arXiv:2407.13292},
  year   = {2024}
}

备注

Accepted into ISCSLP 2024