自监督学习语音预训练模型的同语言与跨语言音素识别性能预测
音频与语音处理
2022-06-28 v1 声音
摘要
在本工作中,我们分析并比较了从不同冻结的自监督学习(SSL)语音预训练模型中提取的语音表征,考察其捕捉发音特征(AF)信息的能力,以及随后对同语言与跨语言场景下音素识别性能的预测能力。具体而言,我们比较了CPC、wav2vec 2.0和HuBert。首先,实现了帧级AF探测任务。随后,实现了用于音素识别任务的音素级端到端ASR系统,并将帧级AF探测任务性能与音素准确率相关联。与常规语音表征MFCC相比,所有SSL预训练语音表征都捕捉了更多AF信息,并在同语言与跨语言下取得了更好的音素识别性能,其中HuBert表现最佳。帧级AF探测任务是音素识别性能的良好预测指标,显示了语音表征中捕捉AF信息的重要性。与MFCC相比,在同语言场景中,这些SSL语音预训练模型在AF探测任务上的性能实现了最高34.4%的相对提升,并带来了最低10.2%的PER。在跨语言场景中,最高26.7%的相对提升同样带来了最低23.0%的PER。
引用
@article{arxiv.2206.12489,
title = {Predicting within and across language phoneme recognition performance of self-supervised learning speech pre-trained models},
author = {Hang Ji and Tanvina Patel and Odette Scharenborg},
journal= {arXiv preprint arXiv:2206.12489},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022