中文

AC/DC:深度神经网络的交替压缩/解压缩训练

机器学习 2021-12-16 v2 人工智能

摘要

深度神经网络(DNNs)日益增长的计算需求引发了人们对获取稀疏且准确的 DNN 模型的浓厚兴趣。近期工作研究了更困难的稀疏训练情形,即 DNN 权重尽可能早地保持稀疏以降低训练期间的计算成本。现有稀疏训练方法往往依赖经验,且相对于稠密基线可能有更低的精度。本文中,我们提出一种称为深度神经网络交替压缩/解压缩(AC/DC)训练的通用方法,证明了该算法一个变体的收敛性,并表明在相似计算预算下 AC/DC 在精度上优于现有稀疏训练方法;在高稀疏度水平下,AC/DC 甚至优于依赖精确预训练稠密模型的现有方法。AC/DC 的一个重要特性是允许稠密与稀疏模型协同训练,在训练过程结束时产生准确的稀疏-稠密模型对。这在实际应用中很有用,在资源受限环境中部署时可能希望使用压缩变体而无需重做整个训练流程,同时也让我们深入认识稠密与压缩模型之间的精度差距。代码见:https://github.com/IST-DASLab/ACDC 。

关键词

引用

@article{arxiv.2106.12379,
  title  = {AC/DC: Alternating Compressed/DeCompressed Training of Deep Neural Networks},
  author = {Alexandra Peste and Eugenia Iofinova and Adrian Vladu and Dan Alistarh},
  journal= {arXiv preprint arXiv:2106.12379},
  year   = {2021}
}

备注

Accepted at NeurIPS 2021