PARQ: 分段仿射正则化量化
机器学习
2025-03-21 v1 最优化与控制
摘要
我们发展了一种原则性的方法,用于大规模机器学习模型的量化感知训练 (QAT)。具体而言,我们表明凸的分段仿射正则化 (PAR) 能有效地诱导模型参数聚集到离散值。我们采用聚合 proximal 随机梯度方法 (AProx) 最小化 PAR 正则化损失函数,并证明其具有 last-iterate 收敛性。我们的做法为广泛使用的直通估计器 (STE) 提供了一种解释,将其视为 PARQ 的渐近形式。我们进行实验,表明 PARQ 在卷积和基于 transformer 的视觉任务上能够获得具竞争力的性能。
引用
@article{arxiv.2503.15748,
title = {PARQ: Piecewise-Affine Regularized Quantization},
author = {Lisa Jin and Jianhao Ma and Zechun Liu and Andrey Gromov and Aaron Defazio and Lin Xiao},
journal= {arXiv preprint arXiv:2503.15748},
year = {2025}
}