用于语音合成质量的深度学习 MOS 预测器比较
音频与语音处理
2023-11-27 v2
摘要
随着有监督与自监督学习(SSL)MOS 预测器的发展,语音合成质量预测取得了显著进展,但一些与数据相关的方面仍不清楚并需进一步研究。本文中,我们基于 wav2vec 2.0 和 NISQA 语音质量预测模型评估若干 MOS 预测器,以探究训练数据的作用、系统类型的影响,以及跨域特征在 SSL 模型中的作用。我们的评估基于 VoiceMOS 挑战数据集。结果表明,与有监督模型相比,基于 SSL 的模型展现出最高的相关性和最低的均方误差。本研究的关键在于,仅对 MOS 预测器的统计性能进行基准测试不足以对模型排序,因为数据中隐藏的潜在问题可能使评估性能产生偏差。
引用
@article{arxiv.2204.02249,
title = {A Comparison of Deep Learning MOS Predictors for Speech Synthesis Quality},
author = {Alessandro Ragano and Emmanouil Benetos and Michael Chinen and Helard B. Martinez and Chandan K. A. Reddy and Jan Skoglund and Andrew Hines},
journal= {arXiv preprint arXiv:2204.02249},
year = {2023}
}
备注
Accepted ISSC 2023