面向三值权重生成式语言模型的令牌缩放对数蒸馏
计算与语言
2023-12-05 v4
摘要
生成式语言模型(GLMs)在文本生成、理解与推理等任务中展现出令人印象深刻的性能。然而,庞大的模型规模给实际部署带来了挑战。为解决该问题,量化感知训练(QAT)日益流行。然而,当前面向生成式模型的 QAT 方法导致了明显的精度损失。为应对此问题,我们提出了一种专为 GLMs 设计的新型知识蒸馏方法。我们的方法称为令牌缩放对数蒸馏(token-scaled logit distillation),可防止过拟合并从教师模型与真实标签中获得更优的学习效果。本研究首次对大规模 GLMs 的三值权重量化感知训练进行了评估,其困惑度下降小于 1.0,并在常识问答、算术推理以及自然语言理解等任务中实现了精度提升。我们的代码已发布于 https://github.com/aiha-lab/TSLD。
引用
@article{arxiv.2308.06744,
title = {Token-Scaled Logit Distillation for Ternary Weight Generative Language Models},
author = {Minsoo Kim and Sihwa Lee and Janghwan Lee and Sukjin Hong and Du-Seong Chang and Wonyong Sung and Jungwook Choi},
journal= {arXiv preprint arXiv:2308.06744},
year = {2023}
}
备注
NeurIPS 2023 Camera Ready