中文

超越离散性:量化中直通估计器的有限样本分析

机器学习 2025-05-26 v1 最优化与控制

摘要

训练量化神经网络需要解决底层优化问题的不可微和离散特性。为应对这一挑战,直通估计器(STE)已成为最广泛采用的启发式方法,通过引入替代梯度允许通过离散操作进行反向传播。然而,其理论性质在很大程度上尚未被探索,现有少数工作通过假设无限训练数据来简化分析。相比之下,本工作首次在神经网络量化的语境下对 STE 进行了有限样本分析。我们的理论结果突显了样本量在 STE 成功中的关键作用,这是现有研究所缺乏的关键洞见。具体而言,通过分析具有二值权重和激活函数的两层神经网络的量化感知训练,我们推导出了以数据维度表示的样本复杂度界,该界保证了基于 STE 的优化收敛到全局最小值。此外,在标签噪声存在的情况下,我们揭示了 STE 梯度方法的一个有趣的递归性质,即迭代点反复逃离并返回到最优二值权重。我们的分析利用了压缩感知和动力系统理论的工具。

关键词

引用

@article{arxiv.2505.18113,
  title  = {Beyond Discreteness: Finite-Sample Analysis of Straight-Through Estimator for Quantization},
  author = {Halyun Jeong and Jack Xin and Penghang Yin},
  journal= {arXiv preprint arXiv:2505.18113},
  year   = {2025}
}