VQTTS:基于自监督VQ声学特征的高保真语音合成
音频与语音处理
2024-10-25 v4 声音
摘要
主流的神经文本到语音(TTS)流程是一个级联系统,包括从输入文本预测声学特征的声学模型(AM)以及根据给定声学特征生成波形的声码器。然而,当前TTS系统中的声学特征通常是梅尔谱图,其在时间和频率轴上以复杂方式高度相关,导致AM难以预测。尽管最近的神经声码器能从真值(GT)梅尔谱图生成高保真音频,但GT与AM预测的梅尔谱图之间的差距降低了整个TTS系统的性能。在本工作中,我们提出VQTTS,由AM txt2vec和声码器 vec2wav组成,其使用自监督向量量化(VQ)声学特征而非梅尔谱图。我们相应地重新设计了AM和声码器。特别地,txt2vec基本变为分类模型而非传统的回归模型,而vec2wav在HifiGAN生成器之前使用额外的特征编码器以平滑不连续的量化特征。我们的实验表明,在使用自监督VQ声学特征时,vec2wav比HifiGAN取得更好的重构性能。此外,我们的整个TTS系统VQTTS在所有当前公开可用的TTS系统中在自然度方面达到了最先进的性能。
引用
@article{arxiv.2204.00768,
title = {VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature},
author = {Chenpeng Du and Yiwei Guo and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2204.00768},
year = {2024}
}
备注
Accepted to Interspeech 2022