中文

文本深度学习模型压缩:综述

计算与语言 2021-06-15 v4 人工智能 计算机视觉与模式识别 机器学习

摘要

近年来,自然语言处理(NLP)和信息检索(IR)领域取得了巨大进展,这得益于循环神经网络(RNNs)、门控循环单元(GRUs)和长短期记忆(LSTMs)网络等深度学习模型,以及基于 Transformer [120] 的模型如来自变换器的双向编码器表示(BERT)[24]、生成式预训练 Transformer(GPT-2)[94]、多任务深度神经网络(MT-DNN)[73]、超长网络(XLNet)[134]、文本到文本迁移 Transformer(T5)[95]、T-NLG [98] 和 GShard [63]。但这些模型规模庞大。另一方面,现实世界的应用要求模型体积小、响应时间短且计算功耗低。在本综述中,我们讨论了六类不同的方法(剪枝、量化、知识蒸馏、参数共享、张量分解和基于次二次 Transformer 的方法)来压缩此类模型,以实现其在真实工业 NLP 项目中的部署。鉴于构建高效小型模型应用的迫切需求,以及该领域近期发表的大量工作,我们相信本综述将过去几年'深度学习用于 NLP'社区所做的海量工作组织起来,并呈现为一个连贯的故事。

关键词

引用

@article{arxiv.2008.05221,
  title  = {Compression of Deep Learning Models for Text: A Survey},
  author = {Manish Gupta and Puneet Agrawal},
  journal= {arXiv preprint arXiv:2008.05221},
  year   = {2021}
}

备注

Accepted at TKDD for publication. 53 pages