中文

用结构化彩票修剪深度生成音频模型

机器学习 2020-08-03 v1 多媒体 声音 音频与语音处理 机器学习

摘要

深度学习模型在大多数音频应用领域提供了极为成功的解决方案。然而,这些模型的高精度是以巨大的计算成本为代价的。在评估所提模型质量时,这一方面几乎总是被忽视。然而,不应在不考虑模型复杂度的情形下评估模型。这一点在音频应用中尤为关键,因其严重依赖具有实时限制的专用嵌入式硬件。在本文中,我们基于深度模型高度过参数化的最新观察,通过研究深度生成音频模型上的彩票假设来展开工作。该假设指出,深度模型中存在极高效的小子网络,若单独训练将提供比大模型更高的精度。然而,彩票是通过依赖非结构化掩码发现的,这意味着所得模型在磁盘大小或推理时间上均无任何收益。相反,我们在此开发了一种旨在执行结构化剪枝的方法。我们表明这需要依赖全局选择,并引入了基于互信息的特定准则。首先,我们确认了较小模型比其大型对应模型提供更高精度这一令人惊讶的结果。我们进一步表明,我们可以移除多达 95% 的模型权重而不造成精度的显著下降。因此,我们可以获得跨 Wavenet、SING 或 DDSP 等流行方法的极轻量生成音频模型,其体积小至 1/100 且精度相当。我们研究了在 Raspberry Pi 和 Arduino 上嵌入这些模型的理论界限,并表明我们可以在 CPU 上获得与大型 GPU 模型质量相当的生成模型。最后,我们讨论了在嵌入式平台上实现深度生成音频模型的可能性。

关键词

引用

@article{arxiv.2007.16170,
  title  = {Diet deep generative audio models with structured lottery},
  author = {Philippe Esling and Ninon Devis and Adrien Bitton and Antoine Caillon and Axel Chemla--Romeu-Santos and Constance Douwes},
  journal= {arXiv preprint arXiv:2007.16170},
  year   = {2020}
}

备注

8 pages, 5 figures. Proceedings of the 23rd International Conference on Digital Audio Effects (DAFx-20), Vienna, Austria, September 8-12, 2020