利用自监督表征进行 MOS 预测
音频与语音处理
2021-09-21 v3 机器学习
声音
摘要
数十年来,语音质量评估一直是语音处理中的关键问题。现有自动评估通常需干净参考或平行真值数据,在数据量激增时不可行。另一方面,主观测试不需额外干净或平行数据且与人类感知相关性更好。然而,此类测试因需众包而昂贵且耗时。因此,开发一种与人类感知高度相关且不需真值数据的自动评估方法变得极为迫切。本文中,我们使用自监督预训练模型进行 MOS 预测。我们表明其表征能区分干净与含噪音频。随后,我们以端到端方式微调这些预训练模型并接简单线性层。实验结果表明,我们的框架在 Voice Conversion Challenge 2018 上显著优于此前两个 SOTA 模型,并在 Voice Conversion Challenge 2016 上取得可比或更优性能。我们还进行了消融实验以进一步探究各模块对该任务的贡献。实验结果使用公开可用工具包实现并可复现。
引用
@article{arxiv.2104.03017,
title = {Utilizing Self-supervised Representations for MOS Prediction},
author = {Wei-Cheng Tseng and Chien-yu Huang and Wei-Tsung Kao and Yist Y. Lin and Hung-yi Lee},
journal= {arXiv preprint arXiv:2104.03017},
year = {2021}
}
备注
In Proceedings of Interspeech 2021. We acknowledge the support of AWS Machine Learning Research Awards program. Source code available at https://github.com/s3prl/s3prl/tree/master/s3prl/downstream/mos_prediction