用于MOS预测的语音表征评估
声音
2023-06-19 v1 人工智能
音频与语音处理
摘要
在本文中,我们评估用于预测语音质量的特征提取模型。我们还提出一种模型架构,以比较监督学习与自监督学习模型的嵌入和说话人验证模型的嵌入,从而预测MOS指标。我们的实验在VCC2018数据集与一项为本工作创建的巴西葡萄牙语数据集BRSpeechMOS上进行。结果表明,Whisper模型在所有场景下均适用:包括VCC2018与BRSpeech-MOS数据集。在使用BRSpeechMOS的监督与自监督学习模型中,Whisper-Small取得了0.6980的最佳线性相关,而说话人验证模型SpeakerNet的线性相关为0.6963。使用VCC2018时,最佳监督与自监督学习模型Whisper-Large取得0.7274的线性相关,最佳说话人验证模型TitaNet取得0.6933的线性相关。尽管说话人验证模型结果略低,SpeakerNet模型仅有5M参数,适合实时应用,且TitaNet模型产生尺寸为192的嵌入,为所有评估模型中最小。实验结果可用公开源代码重复。
引用
@article{arxiv.2306.09979,
title = {Evaluation of Speech Representations for MOS prediction},
author = {Frederico S. Oliveira and Edresson Casanova and Arnaldo Cândido Júnior and Lucas R. S. Gris and Anderson S. Soares and Arlindo R. Galvão Filho},
journal= {arXiv preprint arXiv:2306.09979},
year = {2023}
}
备注
12 pages, 4 figures, Accepted to the 26th International Conference of Text, Speech and Dialogue (TSD2023)