中文

SqueezeWave:用于设备端语音合成的极轻量级声码器

声音 2020-01-17 v1 音频与语音处理

摘要

自动语音合成是一项具有挑战性的任务,随着边缘设备开始通过语音与用户交互,其重要性日益增加。典型的文本到语音流程包括一个声码器,用于将中间音频表示转换为音频波形。大多数现有声码器难以并行化,因为每个生成样本都依赖于先前的样本。WaveGlow是一种基于流的前馈替代方案,用于替代这些自回归模型(Prenger等人,2019)。然而,尽管WaveGlow易于并行化,该模型对于边缘设备上的实时语音合成而言过于昂贵。本文提出SqueezeWave,一系列基于WaveGlow的轻量级声码器,能以少61倍至214倍的MAC生成与WaveGlow质量相近的音频。代码、训练好的模型和生成的音频已在https://github.com/tianrengao/SqueezeWave公开提供。

关键词

引用

@article{arxiv.2001.05685,
  title  = {SqueezeWave: Extremely Lightweight Vocoders for On-device Speech Synthesis},
  author = {Bohan Zhai and Tianren Gao and Flora Xue and Daniel Rothchild and Bichen Wu and Joseph E. Gonzalez and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2001.05685},
  year   = {2020}
}