探索微调数据对wav2vec 2.0模型盲语音质量预测的影响
音频与语音处理
2022-04-06 v1
摘要
近期研究展示了自监督模型如何产生准确的语音质量预测。由预训练wav2vec 2.0模型生成的语音表示允许使用少量标注数据构建鲁棒预测模型。这为在标注数据稀缺场景下开发强模型提供了可能。已知微调可提升模型性能;然而,用于微调的数据(如语言、样本量)如何影响该性能尚不清楚。本文中,我们探索使用不同语音语料库微调wav2vec 2.0如何影响其性能。我们选取了四个包含常见会议应用中退化的语音数据集,并针对不同的语言与数据规模场景微调wav2vec 2.0。微调后的模型在所有四个会议数据集及一个额外的含合成语音的数据集上测试,并与三个外部基线模型比较。结果显示微调模型能够与基线模型竞争。更大的微调数据保证更好性能;同时,语言多样性帮助模型处理特定语言。需进一步研究评估其他用多语言数据集预训练的wav2vec 2.0模型,并开发对语言多样性更具韧性的预测模型。
引用
@article{arxiv.2204.02135,
title = {Exploring the influence of fine-tuning data on wav2vec 2.0 model for blind speech quality prediction},
author = {Helard Becerra and Alessandro Ragano and Andrew Hines},
journal= {arXiv preprint arXiv:2204.02135},
year = {2022}
}
备注
Submitted to Interspeech 2022