不确定性作为预测器:利用自监督学习进行零样本MOS预测
声音
2023-12-27 v1 音频与语音处理
机器学习
摘要
在语音合成和转换系统中预测音频质量是一项关键但具有挑战性的任务,尤其是当传统方法如平均意见得分(MOS)在大规模收集中较为繁琐时。本文解决了高效音频质量预测的空白,特别是在可能无法获得大规模听力测试的广泛MOS数据的低资源场景中。我们证明了从开箱即用的预训练自监督学习(SSL)模型(如wav2vec)中导出的不确定性度量与MOS分数相关。这些发现基于2022年和2023年VoiceMOS挑战赛的数据。我们探索了这种相关性在不同模型和语言背景下的程度,揭示了SSL模型中的固有不确定性如何作为音频质量评估的有效代理。特别地,我们表明对比性wav2vec模型在所有设置中表现最佳。
引用
@article{arxiv.2312.15616,
title = {Uncertainty as a Predictor: Leveraging Self-Supervised Learning for Zero-Shot MOS Prediction},
author = {Aditya Ravuri and Erica Cooper and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2312.15616},
year = {2023}
}
备注
5 pages, 3 figures, sasb draft