面向高效 Transformer 训练的动态暂存量化
机器学习
2023-03-10 v1 计算与语言
性能
摘要
大语言模型(LLMs)在一系列自然语言处理(NLP)任务上展现出了令人印象深刻的性能。遗憾的是,LLM 训练所需的大量计算与内存访问使其在硬件成本上极其昂贵,因而难以部署于设备端学习等应用场景。本文受 LLM 训练受内存限制这一观察的启发,提出了一种新颖的动态量化策略,称为动态暂存量化(DSQ),其特别侧重于减少内存操作,同时也享有低精度训练的其他益处,例如降低算术成本。我们在两个翻译任务(从头训练)和三个分类任务(微调)上进行了深入研究。与设备端学习中广泛使用的标准 16 位定点相比,DSQ 在 IWSLT17 上将算术操作量减少了 ,将 DRAM 操作数减少了 。
引用
@article{arxiv.2303.05295,
title = {Dynamic Stashing Quantization for Efficient Transformer Training},
author = {Guo Yang and Daniel Lo and Robert Mullins and Yiren Zhao},
journal= {arXiv preprint arXiv:2303.05295},
year = {2023}
}