中文

保持梯度流动:利用梯度流研究稀疏网络优化

机器学习 2021-06-17 v2 计算机视觉与模式识别

摘要

训练稀疏网络以收敛到与稠密神经架构相同的性能已被证明难以实现。近期工作表明初始化是关键。然而,尽管该研究方向已取得一定成功,仅关注初始化似乎并不充分。在本文中,我们采取更广阔的视角审视稀疏网络的训练,并考虑正则化、优化与架构选择对稀疏模型的作用。我们提出了一个简单的实验框架——同容量稀疏对稠密比较(Same Capacity Sparse vs Dense Comparison, SC-SDC),可对稀疏与稠密网络进行公平比较。此外,我们提出了一种新的梯度流度量——有效梯度流(Effective Gradient Flow, EGF),其更好地与稀疏网络中的性能相关。利用顶层指标、SC-SDC 与 EGF,我们表明稠密网络默认的优化器、激活函数与正则化器选择可能不利于稀疏网络。基于这些发现,我们展示通过重新考量架构设计与训练机制的部分方面,可改善稀疏网络中的梯度流。我们的工作表明初始化仅是谜题中的一块,采取更广阔的视角以定制稀疏网络的优化可带来有前景的结果。

关键词

引用

@article{arxiv.2102.01670,
  title  = {Keep the Gradients Flowing: Using Gradient Flow to Study Sparse Network Optimization},
  author = {Kale-ab Tessera and Sara Hooker and Benjamin Rosman},
  journal= {arXiv preprint arXiv:2102.01670},
  year   = {2021}
}