面向端到端轻量级语音合成的基于对抗学习的中间声学特征
声音
2023-08-29 v2 音频与语音处理
摘要
为简化生成过程,若干文本到语音(TTS)系统隐式学习中间潜在表征,而非依赖预定义特征(如梅尔频谱)。然而,由于这些表征缺乏语音变化性,其生成质量不尽如人意。在本文中,我们通过向潜在表征添加\emph{韵律嵌入}来改进 TTS 性能。训练期间,我们从梅尔频谱中提取参考韵律嵌入;推理期间,我们使用生成对抗网络(GANs)从文本估计这些嵌入。利用 GANs,我们以快速方式可靠估计韵律嵌入,因其由于语音的动态特性而具有复杂分布。我们还展示韵律嵌入可作为高效特征,用于学习文本与声学特征间的鲁棒对齐。我们提出的模型在对比实验中以更少的参数量与计算复杂度超越了若干公开可用模型。
引用
@article{arxiv.2204.02172,
title = {Adversarial Learning of Intermediate Acoustic Feature for End-to-End Lightweight Text-to-Speech},
author = {Hyungchan Yoon and Seyun Um and Changwhan Kim and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2204.02172},
year = {2023}
}
备注
INTERSPEECH 2023