Period VITS:用于端到端情感语音合成的带显式音高建模的变分推断
音频与语音处理
2023-02-23 v2 机器学习
声音
摘要
已有若干完全端到端的文本到语音(TTS)模型被提出,其性能优于级联模型(即分别训练声学模型与声码器模型)。然而,当数据集包含情感属性(即发音与韵律的较大多样性)时,它们常生成不稳定的音高轮廓并带有可听见的伪影。为解决此问题,我们提出 Period VITS,一种融合显式周期性生成器的新型端到端 TTS 模型。在所提方法中,我们引入一个帧音高预测器,从输入文本预测韵律特征,如音高与清浊音标志。基于这些特征,所提周期性生成器产生样本级正弦源,使波形解码器能准确复现音高。最终,整个模型以变分推断与对抗目标以端到端方式联合优化。结果表明,解码器能够生成更稳定、更具表现力且更自然的输出波形。实验结果显示,所提模型在自然度上显著优于基线模型,且生成样本的音高稳定性有所提升。
引用
@article{arxiv.2210.15964,
title = {Period VITS: Variational Inference with Explicit Pitch Modeling for End-to-end Emotional Speech Synthesis},
author = {Yuma Shirahata and Ryuichi Yamamoto and Eunwoo Song and Ryo Terashima and Jae-Min Kim and Kentaro Tachibana},
journal= {arXiv preprint arXiv:2210.15964},
year = {2023}
}
备注
ICASSP 2023