中文

Variator:以即插即用压缩模块加速预训练模型

计算与语言 2024-02-21 v2

摘要

预训练语言模型(PLMs)在NLP任务上取得了卓越成果,但代价是庞大的参数规模及随之而来的计算成本。本文提出Variator,一种通过即插即用压缩插件提升计算效率的参数高效加速方法。压缩插件旨在将多个隐藏向量压缩为一个从而缩减序列长度,并在原始PLMs冻结的条件下进行训练。不同于将PLMs压缩至更小规模的传统模型加速方法,Variator具有两点显著优势:(1) 在实际应用中,压缩插件的即插即用特性使得能够根据当前工作负载动态选择具有不同加速比的不同压缩插件。(2) 压缩插件由少量参数极少的紧凑神经网络层构成,显著节省存储与内存开销,尤其在任务数量不断增长的场景下。我们在七个数据集上验证了Variator的有效性。实验结果表明,Variator仅用0.9%的额外参数即可节省53%的计算成本,且性能下降小于2%。此外,当模型规模扩展至数十亿参数时,Variator可匹配未压缩PLMs的强劲性能。

关键词

引用

@article{arxiv.2310.15724,
  title  = {Variator: Accelerating Pre-trained Models with Plug-and-Play Compression Modules},
  author = {Chaojun Xiao and Yuqi Luo and Wenbin Zhang and Pengle Zhang and Xu Han and Yankai Lin and Zhengyan Zhang and Ruobing Xie and Zhiyuan Liu and Maosong Sun and Jie Zhou},
  journal= {arXiv preprint arXiv:2310.15724},
  year   = {2024}
}

备注

Accepted by Findings of EMNLP