中文

自监督学习语音预训练模型的同语言与跨语言音素识别性能预测

音频与语音处理 2022-06-28 v1 声音

摘要

在本工作中,我们分析并比较了从不同冻结的自监督学习(SSL)语音预训练模型中提取的语音表征,考察其捕捉发音特征(AF)信息的能力,以及随后对同语言与跨语言场景下音素识别性能的预测能力。具体而言,我们比较了CPC、wav2vec 2.0和HuBert。首先,实现了帧级AF探测任务。随后,实现了用于音素识别任务的音素级端到端ASR系统,并将帧级AF探测任务性能与音素准确率相关联。与常规语音表征MFCC相比,所有SSL预训练语音表征都捕捉了更多AF信息,并在同语言与跨语言下取得了更好的音素识别性能,其中HuBert表现最佳。帧级AF探测任务是音素识别性能的良好预测指标,显示了语音表征中捕捉AF信息的重要性。与MFCC相比,在同语言场景中,这些SSL语音预训练模型在AF探测任务上的性能实现了最高34.4%的相对提升,并带来了最低10.2%的PER。在跨语言场景中,最高26.7%的相对提升同样带来了最低23.0%的PER。

关键词

引用

@article{arxiv.2206.12489,
  title  = {Predicting within and across language phoneme recognition performance of self-supervised learning speech pre-trained models},
  author = {Hang Ji and Tanvina Patel and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2206.12489},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022