ZO-SAM:用于高效稀疏训练的零阶锐度感知最小化
机器学习
2026-03-16 v1
摘要
深度学习模型尽管取得了显著成就,但仍 suffer于高计算成本和内存要求,限制了其在资源受限环境中的可用性。稀疏神经网络通过大幅度减少参数数量和计算开销来显著缓解这些限制。然而,现有的稀疏训练方法常常经历混乱且噪声较大的梯度信号,严重阻碍收敛和泛化性能,尤其在高稀疏度时尤为如此。为解决这一关键挑战,我们提出了零阶锐度感知最小化(ZO-SAM),一种新型优化框架,战略性地将零阶优化集成到 SAM 方法中。不同于传统 SAM,ZO-SAM 在扰动期间仅需一次反向传播步骤, selectively 利用零阶梯度估计。这种创新方法将反向传播计算成本缩减一半,显著降低梯度方差,有效消除相关计算开销。通过利用 SAM 识别平坦最小值的能力,ZO-SAM 稳定训练过程并加速收敛。这些效率提升在稀疏训练场景中尤为重要,在该场景下计算成本是限制 SAM 实用性的主要瓶颈。此外,使用 ZO-SAM 训练的模型在分布迁移下表现出更好的鲁棒性,进一步拓宽了其在实际部署中的实用性。
引用
@article{arxiv.2603.13115,
title = {ZO-SAM: Zero-Order Sharpness-Aware Minimization for Efficient Sparse Training},
author = {Jie Ji and Gen Li and Kaiyuan Deng and Fatemeh Afghah and Xiaolong Ma},
journal= {arXiv preprint arXiv:2603.13115},
year = {2026}
}