WaveNet声码器上深度学习模型压缩技术的实证评估
机器学习
2020-11-23 v1 声音
音频与语音处理
摘要
WaveNet 是一种最先进的文本到语音声码器,因其自回归循环而难以部署。本文关注在不修改架构的前提下直接加速原始 WaveNet 架构的方法,以使该模型可作为可扩展文本到语音系统的一部分进行部署。我们调研了多种适用于一系列硬件平台部署的模型压缩技术。具体而言,我们比较了不同的模型稀疏化方法与稀疏水平,以及作为量化目标的七种广泛使用的精度;相较于稠密单精度浮点基线,能够在音频保真度不损失的情况下实现高达 13.84 的压缩比。所有技术均使用现有开源深度学习框架与库实现,以鼓励其更广泛采用。
引用
@article{arxiv.2011.10469,
title = {Empirical Evaluation of Deep Learning Model Compression Techniques on the WaveNet Vocoder},
author = {Sam Davis and Giuseppe Coccia and Sam Gooch and Julian Mack},
journal= {arXiv preprint arXiv:2011.10469},
year = {2020}
}