离散参数更新方案的收敛性
机器学习
2025-12-08 v2 最优化与控制
摘要
现代深度学习模型需要巨大的计算资源,这推动了低精度训练的研究。定量训练通过将训练组件表示为低位整数来解决这一问题,但通常依赖于对连续更新进行离散化。我们引入了另一种方法,其中更新规则本身为离散的,通过设计避免对连续更新的量化。我们为一类通用的离散方案建立了收敛性保证,并以具体的多项式更新规则为例进行支持,并通过实证评估进行验证。这一视角为高效训练开辟了新途径,尤其适用于具有内在离散结构的模型。
引用
@article{arxiv.2512.04051,
title = {Convergence for Discrete Parameter Update Schemes},
author = {Paul Wilson and Fabio Zanasi and George Constantinides},
journal= {arXiv preprint arXiv:2512.04051},
year = {2025}
}
备注
opt-ml 2025 workshop at NeurIPS