多语言语音预训练中用于低资源语音识别的语言通用音素表示
音频与语音处理
2023-05-22 v1 计算与语言
声音
摘要
我们通过融合多语言训练与自监督学习的思想来改进低资源 ASR。具体而言,我们利用国际音标(International Phonetic Alphabet, IPA)多语言模型为无标签语音创建帧级伪标签,并使用这些伪标签以音素知情的方式引导基于隐藏单元 BERT(hidden-unit BERT, HuBERT)的语音预训练。在 Multilingual Speech(MLS)语料库上的实验表明,所提方法在所有目标语言上均一致优于标准 HuBERT。此外,在 4 种语言中的 3 种上,与标准 HuBERT 相比,该方法表现更优,同时最多可节省 1.5k 小时(75%)的有监督训练数据。我们的方法以远少的预训练小时数与语言多样性优于大多数 SOTA,与 XLSR-53 和一种基于重训练的多语言方法相比,我们的方法在完整与有限微调数据场景下均表现更优。
引用
@article{arxiv.2305.11569,
title = {Language-Universal Phonetic Representation in Multilingual Speech Pretraining for Low-Resource Speech Recognition},
author = {Siyuan Feng and Ming Tu and Rui Xia and Chuanzeng Huang and Yuxuan Wang},
journal= {arXiv preprint arXiv:2305.11569},
year = {2023}
}
备注
Accepted for publication in INTERSPEECH 2023