中文

高斯权采样用于可扩展、高效且稳定的伪量化训练

机器学习 2025-05-19 v1

摘要

大语言模型(LLM)的规模不断增长,推动效率的提升,使全量化训练(FQT)相对于BF16受到青睐。虽然FQT加快了训练速度,但面临一致性挑战,需要在指数级案例中进行搜索,每种情况都需要超过2000亿个标记才能确保稳定性。伪量化训练(PQT)解决了FQT的问题,尽管其研究不够充分。我们详细探讨了PQT的实际含义,提出一种噪声分布R,该分布对浮点(FP)友好,具有理想特性,包括随机精度退火。结果,该方法作为低精度FP参数通过PQT的有效理论基础,利用通过加法和随后FP转换的高效伪量化。我们展示,高斯权采样(1)可扩展:支持FP参数降至FP6,噪声精度提升至9位,同时使用BF16算子;(2)高效:在A100 GPU上,仅需1.40%的计算开销,以Llama2训练标记计时;(3)稳定:在预训练GPT2和Llama2模型时,达到最高10亿参数和3000亿标记,PQT与高斯权采样的性能可与BF16基线相当甚至超越。

关键词

引用

@article{arxiv.2505.11170,
  title  = {Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training},
  author = {Myeonghwan Ahn and Sungjoo Yoo},
  journal= {arXiv preprint arXiv:2505.11170},
  year   = {2025}
}