中文

可量化 Transformer:通过帮助注意力头执行空操作来消除离群值

机器学习 2023-11-10 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

近年来,Transformer 模型已在多个领域被广泛采用,尤其是大语言模型(LLM)显著推动了 AI 领域的发展。由于其规模,这些网络的能力大幅提升,但代价是所需计算量显著增加。量化是减少神经网络计算时间和内存消耗的最有效方法之一。然而,许多研究表明,现代 Transformer 模型倾向于在其激活中学习到强离群值,使其难以量化。为保持可接受的性能,这些离群值的存在要求激活使用更高位宽或不同的数值格式、额外的微调或其他变通方法。我们表明,强离群值与尝试学习“无操作(no-op)”或仅对残差进行部分更新的特定注意力头行为有关。为实现注意力矩阵中无更新所需的精确零值,softmax 的输入在训练中被推得越来越大,从而导致网络其他部分出现离群值。基于这些观察,我们提出对注意力机制的两个简单(独立)修改——截断 softmax 和门控注意力。我们通过实验表明,使用我们方法预训练的模型学习到的离群值显著更小,同时保持甚至有时改善浮点任务性能。这使我们能够将 Transformer 的激活量化为全 INT8 量化而无需任何额外工作。我们在语言模型(BERT、OPT)和视觉 Transformer 上展示了我们方法的有效性。

关键词

引用

@article{arxiv.2306.12929,
  title  = {Quantizable Transformers: Removing Outliers by Helping Attention Heads Do Nothing},
  author = {Yelysei Bondarenko and Markus Nagel and Tijmen Blankevoort},
  journal= {arXiv preprint arXiv:2306.12929},
  year   = {2023}
}