直通梯度与软阈值化是否为稀疏训练所需的一切?
计算机视觉与模式识别
2023-01-25 v1 人工智能
摘要
在训练神经网络时将权重置零有助于降低推理时的计算复杂度。为了在不引起训练中权重剧烈不连续的情况下逐步提高网络的稀疏度,我们的工作结合软阈值化和直通梯度估计来更新被置零权重的原始(即未阈值化)版本。我们的方法称为ST-3(straight-through/soft-thresholding/sparse-training,直通/软阈值化/稀疏训练),在单个训练周期中逐步提高稀疏度时,在准确率/稀疏度以及准确率/FLOPS权衡方面均取得了SOTA结果。特别地,尽管简单,ST-3仍优于采用可微公式或受生物启发神经再生原理的最新方法。这表明有效稀疏化的关键要素主要在于赋予权重跨零状态平滑演化的自由,同时逐步提高稀疏度。源代码和权重见 https://github.com/vanderschuea/stthree
引用
@article{arxiv.2212.01076,
title = {Are Straight-Through gradients and Soft-Thresholding all you need for Sparse Training?},
author = {Antoine Vanderschueren and Christophe De Vleeschouwer},
journal= {arXiv preprint arXiv:2212.01076},
year = {2023}
}