VITS2:通过对抗学习与架构设计提升单阶段文本转语音的质量与效率
声音
2023-08-01 v1 机器学习
音频与语音处理
摘要
单阶段文本转语音模型近期被积极研究,其结果已优于两阶段流水线系统。尽管先前的单阶段模型已取得重大进展,但在间歇性不自然、计算效率以及对音素转换的强依赖方面仍有改进空间。本工作中,我们引入 VITS2,一种单阶段文本转语音模型,通过改进先前工作的若干方面高效合成更自然的语音。我们提出了改进的结构与训练机制,并表明所提方法在提升多说话人模型中自然度、语音特征相似度以及训练与推理效率方面有效。此外,我们证明先前工作中对音素转换的强依赖可通过我们的方法显著减弱,从而实现完全端到端的单阶段方法。
引用
@article{arxiv.2307.16430,
title = {VITS2: Improving Quality and Efficiency of Single-Stage Text-to-Speech with Adversarial Learning and Architecture Design},
author = {Jungil Kong and Jihoon Park and Beomjeong Kim and Jeongmin Kim and Dohee Kong and Sangjin Kim},
journal= {arXiv preprint arXiv:2307.16430},
year = {2023}
}
备注
Interspeech 2023