中文

MBNet:用于合成语音 MOS 预测的均值偏置网络

声音 2021-03-02 v1 音频与语音处理

摘要

平均意见得分(MOS)是评估合成语音质量的常用主观指标,通常需多名人类评委对每条语音话语进行评分。为降低 MOS 测试的人力成本,已提出多种自动预测 MOS 得分的方法。据我们所知,对于一条语音话语,以往所有工作仅将不同评委多个得分的平均值作为训练目标,并丢弃每位评委的个体评分,未能充分利用宝贵的 MOS 训练数据。在本文中,我们提出 MBNet,一种带有均值子网和偏置子网的 MOS 预测器,以更好地利用 MOS 数据集中的每一位评委评分,其中均值子网用于预测每条话语的均值得分(类似于以往工作),偏置子网用于预测偏置得分(均值得分与每位个体评委得分之差)并捕捉个体评委的个人偏好。实验表明,与仅利用均值得分训练的 MOSNet 基线相比,MBNet 在 VCC 2018 数据集上使系统级斯皮尔曼秩相关系数(SRCC)提升 2.9%,在 VCC 2016 数据集上提升 6.7%。

关键词

引用

@article{arxiv.2103.00110,
  title  = {MBNet: MOS Prediction for Synthesized Speech with Mean-Bias Network},
  author = {Yichong Leng and Xu Tan and Sheng Zhao and Frank Soong and Xiang-Yang Li and Tao Qin},
  journal= {arXiv preprint arXiv:2103.00110},
  year   = {2021}
}

备注

Accepted by ICASSP 2021