中文

面向预训练语言模型整数前向与反向传播微调

机器学习 2023-02-14 v2

摘要

一些著名语言模型(如 BERT)的大量参数使其在下流任务上的微调计算密集且耗能巨大。此前研究者聚焦于使用更低比特宽度的整数数据类型进行语言模型的前向传播以节省内存与计算。然而,对于反向传播,仅使用了 16 位浮点数据类型对 BERT 进行微调。本工作中,我们在 BERT 的微调中对前向与反向传播均使用整数算术。我们研究了改变整数比特宽度对模型指标性能的影响。我们的整数微调使用整数算术执行 BERT 线性层、层归一化层和嵌入层的前向传播与梯度计算。我们在 SQuAD v1.1、SQuAD v2. 及 GLUE 基准上使用我们的整数训练方法微调 BERT。我们证明,16 位整数 BERT 微调的指标性能与 16 位及 32 位浮点基线相匹配。此外,使用更快且更省内存的 8 位整数数据类型时,BERT 的整数微调相比 FP32 基线平均损失 3.1 个点。

关键词

引用

@article{arxiv.2209.09815,
  title  = {Towards Fine-tuning Pre-trained Language Models with Integer Forward and Backward Propagation},
  author = {Mohammadreza Tayaranian and Alireza Ghaffari and Marzieh S. Tahaei and Mehdi Rezagholizadeh and Masoud Asgharian and Vahid Partovi Nia},
  journal= {arXiv preprint arXiv:2209.09815},
  year   = {2023}
}

备注

Accepted in EACL2023