R-MelNet:面向神经 TTS 的精简梅尔谱建模
声音
2022-07-01 v1 机器学习
音频与语音处理
摘要
本文介绍 R-MelNet,一种由基于 MelNet 第一层的前端和 WaveRNN 风格后端音频解码器组成的两部分自回归架构,用于神经文本到语音合成。该模型以字符与音素混合序列作为输入,并带有可选的音频 priming 序列,生成低分辨率梅尔谱特征,经插值后由 WaveRNN 解码器用于产生音频波形。结合半精度训练,R-MelNet 在单块商用 GPU(NVIDIA 2080Ti)上使用的 GPU 内存低于 11 GB。我们详述了稳定半精度训练的若干关键实现细节,包括一种近似且数值稳定的 mixture of logistics 注意力。使用随机的每步多样本推理方案,所得模型生成高度多样的音频,同时支持基于文本与音频的控制以修改输出波形。在单说话人 TTS 数据集上训练的 R-MelNet 系统的定性与定量评估证明了我们方法的有效性。
引用
@article{arxiv.2206.15276,
title = {R-MelNet: Reduced Mel-Spectral Modeling for Neural TTS},
author = {Kyle Kastner and Aaron Courville},
journal= {arXiv preprint arXiv:2206.15276},
year = {2022}
}