高效神经音频合成
声音
2018-06-27 v2 机器学习
音频与语音处理
摘要
序列模型在音频、视觉与文本领域就估计数据分布和生成高质量样本而言均达到了最优结果。然而,此类模型的高效采样一直是个棘手问题。聚焦于文本到语音合成,我们描述了一组在保持高输出质量的同时减少采样时间的通用技术。我们首先描述了一个单层循环神经网络 WaveRNN,其具有双 softmax 层,可匹配最优的 WaveNet 模型质量。网络的紧凑形式使其能在 GPU 上以比实时快 4 倍的速度生成 24kHz 16-bit 音频。其次,我们应用权重剪枝技术减少 WaveRNN 中的权重数量。我们发现,对于恒定参数量,大稀疏网络优于小稠密网络,且该关系在稀疏度超过 96% 时仍成立。Sparse WaveRNN 中少量的权重使其能在移动端 CPU 上实时采样高保真音频。最后,我们提出了一种基于子缩放的新生成方案,将长序列折叠为较短序列的批次,并可一次生成多个样本。Subscale WaveRNN 每步生成 16 个样本且不损失质量,并提供了一种正交的采样效率提升方法。
引用
@article{arxiv.1802.08435,
title = {Efficient Neural Audio Synthesis},
author = {Nal Kalchbrenner and Erich Elsen and Karen Simonyan and Seb Noury and Norman Casagrande and Edward Lockhart and Florian Stimberg and Aaron van den Oord and Sander Dieleman and Koray Kavukcuoglu},
journal= {arXiv preprint arXiv:1802.08435},
year = {2018}
}
备注
10 pages