中文

利用韵律与语言特征研究内容感知的神经文本转语音 MOS 预测

声音 2023-05-09 v2 计算与语言 机器学习 音频与语音处理

摘要

当前自动合成语音评估的最先进方法基于 MOS 预测神经模型。此类 MOS 预测模型包括以谱特征为输入的 MOSNet 和 LDNet,以及依赖预训练自监督学习模型、直接以语音信号为输入的 SSL-MOS。在现代高质量神经 TTS 系统中,关于所说话语的韵律恰当性是语音自然度的决定性因素。为此,我们提出将韵律与语言特征作为额外输入纳入 MOS 预测系统,并评估它们对预测结果的影响。我们考虑音素级 F0 与时长特征作为韵律输入,以及 Tacotron 编码器输出、词性标注(POS tags)和 BERT 嵌入作为更高层语言输入。所有 MOS 预测系统均在 SOMOS(一个仅含神经 TTS 数据且带众包自然度 MOS 评估的数据集)上训练。结果表明,所提出的额外特征有益于 MOS 预测任务,通过在话语级和系统级预测上改善预测 MOS 分数与真值的相关性。

关键词

引用

@article{arxiv.2211.00342,
  title  = {Investigating Content-Aware Neural Text-To-Speech MOS Prediction Using Prosodic and Linguistic Features},
  author = {Alexandra Vioni and Georgia Maniati and Nikolaos Ellinas and June Sig Sung and Inchul Hwang and Aimilios Chalamandaris and Pirros Tsiakoulis},
  journal= {arXiv preprint arXiv:2211.00342},
  year   = {2023}
}

备注

Proceedings of ICASSP 2023