理解与改进大型Transformer编码器量化感知训练中的知识蒸馏
计算与语言
2022-11-22 v1 人工智能
摘要
知识蒸馏(KD)一直是模型压缩的通用方法,利用教师模型迁移的知识增强轻量模型的能力。特别地,KD已被用于如BERT等Transformer编码器的量化感知训练(QAT)中,以在权重参数精度降低的情况下提升学生模型的准确率。然而,人们对于何种KD方法最适用于Transformer的QAT知之甚少。本工作中,我们深入分析了KD对量化大型Transformer注意力恢复的作用机制。具体而言,我们揭示此前采用的注意力分数上的MSE损失不足以恢复自注意力信息。因此,我们提出两种KD方法:注意力图损失与注意力输出损失。此外,我们探索了两种损失的统一,以解决注意力图损失与输出损失之间任务相关的偏好问题。在各种Transformer编码器模型上的实验结果表明,所提出的KD方法在亚2比特权重量化QAT下取得了最先进的准确率。
引用
@article{arxiv.2211.11014,
title = {Understanding and Improving Knowledge Distillation for Quantization-Aware Training of Large Transformer Encoders},
author = {Minsoo Kim and Sihwa Lee and Sukjin Hong and Du-Seong Chang and Jungwook Choi},
journal= {arXiv preprint arXiv:2211.11014},
year = {2022}
}
备注
EMNLP 2022 Main Track Long Paper