中文

镜中之掩码:隐式稀疏化

机器学习 2025-02-13 v2

摘要

连续稀疏化策略是降低大规模神经网络推理成本和内存需求的最有效方法之一。其成功的关键因素在于联合学习掩码和权重变量所诱导的隐式 L1 正则化,实验上已证明其优于显式 L1 正则化。我们通过分析学习动力学,为这一观察提供了理论解释,揭示了早期连续稀疏化由隐式 L2 正则化主导,并随时间逐渐过渡为 L1 惩罚。利用这一洞察,我们提出了一种动态控制该隐式偏置强度的方法。通过对镜像流框架的扩展,我们在欠定线性回归的语境中建立了收敛性和最优性保证。我们的理论发现可能具有独立意义,因为我们展示了如何进入丰富的区域,并表明隐式偏置可通过时间依赖的 Bregman 势加以控制。为验证这些洞察,我们引入了 PILoT,一种具有新颖初始化和动态正则化的连续稀疏化方法,在标准实验中持续优于基线方法。

关键词

引用

@article{arxiv.2408.09966,
  title  = {Mask in the Mirror: Implicit Sparsification},
  author = {Tom Jacobs and Rebekka Burkholz},
  journal= {arXiv preprint arXiv:2408.09966},
  year   = {2025}
}

备注

20 pages, 5 figures