利用 spoofing 检测与 spoofing 类型分类多任务学习预测合成语音神经MOS
音频与语音处理
2020-12-03 v2 机器学习
声音
摘要
若干研究提出了基于深度学习的模型来预测合成语音的平均意见得分(MOS),展示了替代人类评分者的可能性。然而,MOS的评分者间与评分者内变异性使得模型难以保证高性能。本文提出一种多任务学习(MTL)方法,利用以下两个辅助任务提升MOS预测模型性能:spoofing检测(SD)与spoofing类型分类(STC)。此外,我们使用焦点损失最大化SD与STC对MOS预测的协同作用。使用Voice Conversion Challenge 2018的MOS评估结果进行的实验表明,所提带两个辅助任务的MTL改善了MOS预测。我们提出的模型相对基线模型实现了高达11.6%的性能相对提升。
引用
@article{arxiv.2007.08267,
title = {Neural MOS Prediction for Synthesized Speech Using Multi-Task Learning With Spoofing Detection and Spoofing Type Classification},
author = {Yeunju Choi and Youngmoon Jung and Hoirin Kim},
journal= {arXiv preprint arXiv:2007.08267},
year = {2020}
}
备注
8 pages, 5 figures, accepted to SLT 2021