中文

Infor-Coef:基于信息瓶颈的动态词元下采样用于紧凑高效语言模型

计算与语言 2023-05-23 v1

摘要

基于Transformer的预训练语言模型(PLMs)的盛行使其被广泛用于各种自然语言处理任务。然而,它们过高的开销导致了较大的延迟和计算成本。静态压缩方法为不同样本分配固定计算量,造成冗余计算。动态词元剪枝方法选择性地缩短序列,但无法改变模型大小,且难以像静态剪枝那样实现加速。本文中,我们提出一种面向大语言模型的模型加速方法,结合动态词元下采样与静态剪枝,并通过信息瓶颈损失进行优化。我们的模型Infor-Coef相比BERT实现了18倍FLOPs加速,且精度下降小于8%。本工作为压缩和加速基于Transformer的NLP任务模型提供了一种有前景的方法。

关键词

引用

@article{arxiv.2305.12458,
  title  = {Infor-Coef: Information Bottleneck-based Dynamic Token Downsampling for Compact and Efficient language model},
  author = {Wenxi Tan},
  journal= {arXiv preprint arXiv:2305.12458},
  year   = {2023}
}