PortaSpeech:轻量且高质量的生成式文本到语音模型
音频与语音处理
2022-02-15 v5 声音
摘要
FastSpeech 2 和 Glow-TTS 等非自回归文本到语音(NAR-TTS)模型能够并行地从给定文本合成高质量语音。在分析了两类生成式 NAR-TTS 模型(VAE 和归一化流)后,我们发现:VAE 即使模型规模较小也善于捕捉长程语义特征(如韵律),但存在结果模糊且不自然的问题;而归一化流善于重建频 bin 级细节,但在模型参数量受限时表现不佳。受这些观察启发,为使用轻量架构生成具有自然细节和丰富韵律的多样化语音,我们提出了 PortaSpeech,一种轻量且高质量的生成式文本到语音模型。具体而言,1)为准确建模韵律和梅尔谱细节,我们采用带有增强先验的轻量 VAE,其后接具有强条件输入的基于流的 post-net 作为主架构。2)为进一步压缩模型规模和内存占用,我们在 post-net 的仿射耦合层中引入分组参数共享机制。3)为提升合成语音的表现力并减少对文本与语音间精确细粒度对齐的依赖,我们提出了一种结合硬词间对齐与软词内对齐的混合对齐语言编码器,显式提取词级语义信息。实验结果表明,在主观和客观评价指标上,PortaSpeech 在语音质量和韵律建模方面均优于其他 TTS 模型,并且在将模型参数缩减至 6.7M 时仅出现轻微性能下降(与 FastSpeech 2 相比约 4 倍的模型大小和 3 倍运行时内存压缩比)。我们广泛的消融研究证明 PortaSpeech 中的每项设计都是有效的。
引用
@article{arxiv.2109.15166,
title = {PortaSpeech: Portable and High-Quality Generative Text-to-Speech},
author = {Yi Ren and Jinglin Liu and Zhou Zhao},
journal= {arXiv preprint arXiv:2109.15166},
year = {2022}
}
备注
Accepted by NeurIPS 2021. Source code: https://github.com/NATSpeech/NATSpeech