中文

面向高效 Transformer 训练的动态暂存量化

机器学习 2023-03-10 v1 计算与语言 性能

摘要

大语言模型(LLMs)在一系列自然语言处理(NLP)任务上展现出了令人印象深刻的性能。遗憾的是,LLM 训练所需的大量计算与内存访问使其在硬件成本上极其昂贵,因而难以部署于设备端学习等应用场景。本文受 LLM 训练受内存限制这一观察的启发,提出了一种新颖的动态量化策略,称为动态暂存量化(DSQ),其特别侧重于减少内存操作,同时也享有低精度训练的其他益处,例如降低算术成本。我们在两个翻译任务(从头训练)和三个分类任务(微调)上进行了深入研究。与设备端学习中广泛使用的标准 16 位定点相比,DSQ 在 IWSLT17 上将算术操作量减少了 20.95×20.95\times,将 DRAM 操作数减少了 2.55×2.55\times

关键词

引用

@article{arxiv.2303.05295,
  title  = {Dynamic Stashing Quantization for Efficient Transformer Training},
  author = {Guo Yang and Daniel Lo and Robert Mullins and Yiren Zhao},
  journal= {arXiv preprint arXiv:2303.05295},
  year   = {2023}
}