探索量化在Transformer语言模型高效预训练中的应用
机器学习
2024-10-14 v2
摘要
Transformer模型规模的增加导致其预训练计算需求的增加。虽然量化在预训练后及微调期间已被证明有效,但在规模化的语言建模中应用于预训练阶段仍 largely 未被探索。本研究旨在探索量化在Transformer预训练中的影响,特别关注线性层组件。通过系统性地对权重、激活、梯度和优化器状态应用直观的线性量化,我们评估其对模型效率、稳定性和训练期间性能的影响。通过提供一套针对Transformer预训练有效量化策略的全面配方,我们推动从零开始的高效训练,同时保留语言建模能力。代码可在https://github.com/chandar-lab/EfficientLLMs获取。
关键词
引用
@article{arxiv.2407.11722,
title = {Exploring Quantization for Efficient Pre-Training of Transformer Language Models},
author = {Kamran Chitsaz and Quentin Fournier and Gonçalo Mordido and Sarath Chandar},
journal= {arXiv preprint arXiv:2407.11722},
year = {2024}
}