中文

基于聚类建模的合成语音深度 MOS 预测器

音频与语音处理 2020-11-10 v1 机器学习 声音 信号处理

摘要

尽管深度学习在语音合成与语音转换方面取得了令人瞩目的进展,合成语音的评估仍由人类参与者进行。近期若干论文提出了基于深度学习的评估模型,并展示了自动化语音质量评估的潜力。为改进先前提出的评估模型 MOSNet,我们提出三种使用基于聚类建模方法的模型:使用全局质量令牌(GQT)层、使用编码层,以及同时使用二者。我们利用 Voice Conversion Challenge 2018 的评估结果进行实验,以预测合成语音的平均意见分以及合成语音与参考语音之间的相似度得分。结果表明,GQT 层通过自动学习任务有用的质量令牌有助于更好地预测人类评估,而编码层有助于更精确地利用帧级得分。

关键词

引用

@article{arxiv.2008.03710,
  title  = {Deep MOS Predictor for Synthetic Speech Using Cluster-Based Modeling},
  author = {Yeunju Choi and Youngmoon Jung and Hoirin Kim},
  journal= {arXiv preprint arXiv:2008.03710},
  year   = {2020}
}

备注

5 pages, 1 figure, accepted to Interspeech 2020