中文

AlphaTuning:大规模预训练语言模型的量化感知参数高效适配

机器学习 2022-10-11 v1 计算与语言

摘要

使用参数高效微调方法适配大规模语言模型正引起越来越多的关注。然而,加速模型本身并通过模型压缩实现更好的推理效率尚未被充分探索。模型压缩可提供减小内存占用、启用低精度计算并最终实现高性价比推理的好处。为结合参数高效适配与模型压缩,我们提出 AlphaTuning,其由预训练语言模型的后训练量化和仅微调量化参数中某些部分以用于目标任务组成。具体而言,AlphaTuning 采用二值编码量化,将全精度参数分解为二值参数和一组单独的缩放因子。在适配阶段,二值值对所有任务冻结,而缩放因子针对下游任务微调。我们证明,当应用于 GPT-2 和 OPT 时,AlphaTuning 在各种下游任务上与全微调具有竞争力,同时在 4-bit 量化下实现 >10 倍压缩比和 >1,000 倍可训练参数数量减少。

关键词

引用

@article{arxiv.2210.03858,
  title  = {AlphaTuning: Quantization-Aware Parameter-Efficient Adaptation of Large-Scale Pre-Trained Language Models},
  author = {Se Jung Kwon and Jeonghoon Kim and Jeongin Bae and Kang Min Yoo and Jin-Hwa Kim and Baeseong Park and Byeongwook Kim and Jung-Woo Ha and Nako Sung and Dongsoo Lee},
  journal= {arXiv preprint arXiv:2210.03858},
  year   = {2022}
}

备注

Findings of EMNLP 2022