中文

面向自然语言理解的Transformer量化感知与张量压缩训练

计算与语言 2024-10-01 v2 人工智能

摘要

微调后的Transformer模型在许多自然语言任务中展现出优越性能。然而,大模型尺寸阻碍了高性能Transformer模型在资源受限设备上的部署。本文提出一种量化感知张量压缩训练方法,以减小基于Transformer模型的模型尺寸、算术操作及最终运行延迟。我们将Transformer的嵌入层与线性层压缩为小的低秩张量核,显著减少模型参数。采用带可学习缩放因子的量化感知训练进一步获得张量压缩模型的低精度表示。所提方法可用于端到端训练与基于蒸馏的训练。为改善收敛,应用逐层蒸馏从预训练Transformer中蒸馏出量化且张量压缩的学生模型。性能在两个自然语言理解任务中得到验证,显示出高达 63×63\times 的压缩比、微小精度损失及显著的推理与训练加速。

关键词

引用

@article{arxiv.2306.01076,
  title  = {Quantization-Aware and Tensor-Compressed Training of Transformers for Natural Language Understanding},
  author = {Zi Yang and Samridhi Choudhary and Siegfried Kunzmann and Zheng Zhang},
  journal= {arXiv preprint arXiv:2306.01076},
  year   = {2024}
}