中文

用于量化乐观对偶平均的逐层量化

机器学习 2025-05-21 v1 最优化与控制

摘要

现代深度神经网络由于结构(维度、激活函数等)和表征特性的差异,在残差、多头注意力等众多不同类型的层中表现出异质性,进而影响预测。我们开发了一个具有紧致方差与码长界限的通用逐层量化框架,以适应训练过程中的异质性。随后,我们在分布式变分不等式(VIs)中应用了一种新的逐层量化技术,提出了一种具有自适应学习率的新型量化乐观对偶平均(QODA)算法,该算法对单调变分不等式实现了具有竞争力的收敛速率。实验表明,在 12+12+ 块 GPU 上训练 Wasserstein GAN 时,QODA 的端到端训练时间较基线实现了高达 150%150\% 的加速。

关键词

引用

@article{arxiv.2505.14371,
  title  = {Layer-wise Quantization for Quantized Optimistic Dual Averaging},
  author = {Anh Duc Nguyen and Ilia Markov and Frank Zhengqing Wu and Ali Ramezani-Kebrya and Kimon Antonakopoulos and Dan Alistarh and Volkan Cevher},
  journal= {arXiv preprint arXiv:2505.14371},
  year   = {2025}
}

备注

Accepted at the International Conference on Machine Learning (ICML 2025)