中文

自定义梯度估计器本质上是伪装的直通估计器

机器学习 2024-05-24 v3

摘要

量化感知训练面临一个根本性挑战:诸如取整等量化函数的导数几乎处处为零,在其他地方则不存在。为解决这一问题,已有研究提出多种量化函数的可微近似。本文证明,当学习率足够小时,一大类权重梯度估计器与直通估计器(STE)等价。具体而言,在替换为 STE 并调整 SGD 中的权重初始化和学习率后,模型的训练方式将与使用原始梯度估计器时几乎完全相同。此外,我们表明,对于 Adam 等自适应学习率算法,无需对权重初始化和学习率进行任何修改即可得到相同结果。我们通过实验证明,这些结果在基于 MNIST 数据集训练的小型卷积模型和基于 ImageNet 训练的 ResNet50 模型上均成立。

关键词

引用

@article{arxiv.2405.05171,
  title  = {Custom Gradient Estimators are Straight-Through Estimators in Disguise},
  author = {Matt Schoenbauer and Daniele Moro and Lukasz Lew and Andrew Howard},
  journal= {arXiv preprint arXiv:2405.05171},
  year   = {2024}
}