中文

LE-SSL-MOS:基于监听器增强的自监督学习MOS预测

音频与语音处理 2023-11-20 v1

摘要

近来,研究者对自动预测语音合成系统主观评价的兴趣日益增长。该预测是一项具有挑战性的任务,尤其在域外测试集上。本文提出一种结合有监督与无监督方法的MOS预测新融合模型。在有监督方面,我们开发了名为LE-SSL-MOS的基于SSL的预测器。LE-SSL-MOS利用预训练的自监督学习模型,并通过在监听器增强分支中使用每条话语的意见分数进一步提升预测精度。在无监督方面,包含两步:我们使用高可懂度领域数据微调单元语言模型(ULM)以改善无监督指标SpeechLMScore的相关性;另一是借助集成学习将ASR置信度用作新指标。据我们所知,这是首个融合有监督与无监督方法进行MOS预测的架构。通过这些方法,我们在VoiceMOS Challenge 2023上的实验结果表明LE-SSL-MOS优于基线。我们的融合系统在含噪与增强语音赛道上相较LE-SSL-MOS取得了13%的绝对提升。我们的系统分别在法语语音合成赛道与挑战的含噪与增强语音赛道中排名第1与第2。

关键词

引用

@article{arxiv.2311.10656,
  title  = {LE-SSL-MOS: Self-Supervised Learning MOS Prediction with Listener Enhancement},
  author = {Zili Qi and Xinhui Hu and Wangjin Zhou and Sheng Li and Hao Wu and Jian Lu and Xinkang Xu},
  journal= {arXiv preprint arXiv:2311.10656},
  year   = {2023}
}

备注

accepted in IEEE-ASRU2023