中文

FBWave:面向边缘端流式文本转语音的高效可扩展神经声码器

声音 2020-11-30 v1 机器学习 音频与语音处理

摘要

如今,越来越多的应用可受益于基于边缘的文本转语音(TTS)。然而,大多数现有 TTS 模型计算开销过大,且灵活性不足,难以部署于计算能力各异的多种边缘设备之上。为此,我们提出 FBWave,一系列高效且可扩展的神经声码器,可为不同边缘设备实现最优的性能—效率权衡。FBWave 是一种基于流的混合生成模型,结合了自回归与非自回归模型的优势。它可生成高质量音频,并在推理时支持流式处理,同时保持极高的计算效率。我们的实验表明,FBWave 在将 MACs 降低 40 倍的同时可达到与 WaveRNN 相近的音频质量。更高效版本的 FBWave 可实现多达 109 倍的 MACs 削减,同时仍提供可接受的音频质量。音频演示见 https://bichenwu09.github.io/vocoder_demos。

关键词

引用

@article{arxiv.2011.12985,
  title  = {FBWave: Efficient and Scalable Neural Vocoders for Streaming Text-To-Speech on the Edge},
  author = {Bichen Wu and Qing He and Peizhao Zhang and Thilo Koehler and Kurt Keutzer and Peter Vajda},
  journal= {arXiv preprint arXiv:2011.12985},
  year   = {2020}
}