中文

WaveNet声码器上深度学习模型压缩技术的实证评估

机器学习 2020-11-23 v1 声音 音频与语音处理

摘要

WaveNet 是一种最先进的文本到语音声码器,因其自回归循环而难以部署。本文关注在不修改架构的前提下直接加速原始 WaveNet 架构的方法,以使该模型可作为可扩展文本到语音系统的一部分进行部署。我们调研了多种适用于一系列硬件平台部署的模型压缩技术。具体而言,我们比较了不同的模型稀疏化方法与稀疏水平,以及作为量化目标的七种广泛使用的精度;相较于稠密单精度浮点基线,能够在音频保真度不损失的情况下实现高达 13.84 的压缩比。所有技术均使用现有开源深度学习框架与库实现,以鼓励其更广泛采用。

关键词

引用

@article{arxiv.2011.10469,
  title  = {Empirical Evaluation of Deep Learning Model Compression Techniques on the WaveNet Vocoder},
  author = {Sam Davis and Giuseppe Coccia and Sam Gooch and Julian Mack},
  journal= {arXiv preprint arXiv:2011.10469},
  year   = {2020}
}