FBWave:面向边缘端流式文本转语音的高效可扩展神经声码器
声音
2020-11-30 v1 机器学习
音频与语音处理
摘要
如今,越来越多的应用可受益于基于边缘的文本转语音(TTS)。然而,大多数现有 TTS 模型计算开销过大,且灵活性不足,难以部署于计算能力各异的多种边缘设备之上。为此,我们提出 FBWave,一系列高效且可扩展的神经声码器,可为不同边缘设备实现最优的性能—效率权衡。FBWave 是一种基于流的混合生成模型,结合了自回归与非自回归模型的优势。它可生成高质量音频,并在推理时支持流式处理,同时保持极高的计算效率。我们的实验表明,FBWave 在将 MACs 降低 40 倍的同时可达到与 WaveRNN 相近的音频质量。更高效版本的 FBWave 可实现多达 109 倍的 MACs 削减,同时仍提供可接受的音频质量。音频演示见 https://bichenwu09.github.io/vocoder_demos。
引用
@article{arxiv.2011.12985,
title = {FBWave: Efficient and Scalable Neural Vocoders for Streaming Text-To-Speech on the Edge},
author = {Bichen Wu and Qing He and Peizhao Zhang and Thilo Koehler and Kurt Keutzer and Peter Vajda},
journal= {arXiv preprint arXiv:2011.12985},
year = {2020}
}