中文

任意精度与稀疏性下神经网络的鲁棒训练

机器学习 2026-03-11 v3 人工智能 计算与语言 计算机视觉与模式识别 数值分析 数值分析

摘要

量化和稀疏化操作固有的非连续性是反向传播的一个长期障碍,尤其在超低精度和稀疏 regime 中更为突出。虽然社区长期认为量化对梯度下降不友好 due to its lack of smoothness,但我们首次指出关键问题在于缺乏允许训练学习对量化噪声鲁棒性的 proper gradient path。标准的直通估计器(STE)加剧了这一问题,其已知的 mismatch 即前向传递中进行量化感知计算,而反向传递则不加关注,从而导致未管理的误差和不稳定性。我们通过将量化显式建模为加性噪声来解决此问题,使完整的前向-反向路径 well-defined,无需 heuristic 梯度估计。以原初的岭回归目标为依据,我们引入一种去噪去量化变换,创建显式的、纠正性的 gradient path,使学习对噪声具有鲁棒性,绕过了 STE 的局限。我们将其扩展到稀疏化,将其视为一种使小值变为零的特殊形式的量化。我们的统一框架可使用现有的 recipe 在任意精度和稀疏性水平下训练模型,实现 A1W1 和亚 1 位网络的稳定训练,其他方法在此类情形下往往不堪一用。它实现了最先进的成果,为现代大型语言模型(LLM)的映射效率边界提供了理论依据,并为实现超高效神经网络提供了坚实的路径。

关键词

引用

@article{arxiv.2409.09245,
  title  = {Robust Training of Neural Networks at Arbitrary Precision and Sparsity},
  author = {Chengxi Ye and Grace Chu and Yanfeng Liu and Yichi Zhang and Lukasz Lew and Li Zhang and Mark Sandler and Andrew Howard},
  journal= {arXiv preprint arXiv:2409.09245},
  year   = {2026}
}