DDOS:一种利用域自适应预训练与意见分数分布的MOS预测框架
音频与语音处理
2022-08-16 v3 机器学习
声音
摘要
平均意见分(MOS)是语音合成系统的典型主观评价指标。由于收集MOS耗时,若存在准确的MOS预测模型用于自动评价则颇为理想。本工作中,我们提出一种新颖的MOS预测模型DDOS。DDOS利用域自适应预训练在合成语音上进一步预训练自监督学习模型,并加入一个所提模块以对每条语音的意见分数分布建模。借助上述组件,DDOS在BVCC数据集上优于以往工作,且在BC2019数据集上的零样本迁移结果显著提升。DDOS还在Interspeech 2022 VoiceMOS挑战赛中以系统级分数获得第二名。
引用
@article{arxiv.2204.03219,
title = {DDOS: A MOS Prediction Framework utilizing Domain Adaptive Pre-training and Distribution of Opinion Scores},
author = {Wei-Cheng Tseng and Wei-Tsung Kao and Hung-yi Lee},
journal= {arXiv preprint arXiv:2204.03219},
year = {2022}
}
备注
Accepted to Interspeech 2022. Code will be available in the future