中文

教师干预:改善超低精度 Transformer 量化感知训练的收敛性

计算与语言 2023-02-24 v1 人工智能

摘要

BERT 等预训练 Transformer 模型在广泛应用中的巨大成功,是以模型复杂度的显著增加为代价的。量化感知训练(QAT)是一种有前景的方法,可降低实现成本与能耗。然而,低于 2 比特的激进量化会因收敛不稳定而导致可观的精度下降,尤其在下游数据集不充足时。本工作提出一种称为教师干预(TI)的主动知识蒸馏方法,用于超低精度预训练 Transformer 的 QAT 快速收敛。TI 以来自教师的完整信号干预逐层信号传播,以消除传播量化误差的干扰,平滑 QAT 的损失曲面并加速收敛。此外,我们提出一种渐进干预机制,以稳定 Transformer 层子部分从量化中的恢复。所提方案能够实现 QAT 的快速收敛,并提升模型精度,且不受下游微调任务多样特性的影响。我们证明,与 SOTA QAT 方法相比,TI 在自然语言处理以及计算机视觉的知名 Transformer 上以显著更少的微调迭代一致地取得更优精度。

关键词

引用

@article{arxiv.2302.11812,
  title  = {Teacher Intervention: Improving Convergence of Quantization Aware Training for Ultra-Low Precision Transformers},
  author = {Minsoo Kim and Kyuhong Shim and Seongmin Park and Wonyong Sung and Jungwook Choi},
  journal= {arXiv preprint arXiv:2302.11812},
  year   = {2023}
}

备注

Accepted to EACL 2023 (main conference)