PITS:无需基频的变分音高推断用于端到端音高可控 TTS
音频与语音处理
2023-06-07 v3 机器学习
声音
摘要
先前的音高可控文本到语音(TTS)模型依赖于直接建模基频,导致合成语音方差较低。为解决此问题,我们提出 PITS,一种利用变分推断建模音高的端到端音高可控 TTS 模型。基于 VITS,PITS 结合了 Yingram 编码器、Yingram 解码器以及音高偏移合成的对抗训练以实现音高可控性。实验表明,PITS 生成的高质量语音与真实语音难以区分,并且具有高音高可控性而无质量下降。代码、音频样本和演示可在 https://github.com/anonymous-pits/pits 获取。
引用
@article{arxiv.2302.12391,
title = {PITS: Variational Pitch Inference without Fundamental Frequency for End-to-End Pitch-controllable TTS},
author = {Junhyeok Lee and Wonbin Jung and Hyunjae Cho and Jaeyeon Kim and Jaehwan Kim},
journal= {arXiv preprint arXiv:2302.12391},
year = {2023}
}
备注
6 pages, preprint