DQ-BART:通过联合蒸馏与量化实现高效序列到序列模型
计算与语言
2022-03-23 v1
摘要
像BART和T5这样的大规模预训练序列到序列模型在许多生成式NLP任务上取得了最先进的性能。然而,由于此类模型内存需求大、延迟高,在资源受限场景下带来了巨大挑战。为缓解该问题,我们提出联合蒸馏与量化模型,将知识从全精度教师模型迁移到量化且蒸馏的低精度学生模型。实证分析表明,尽管生成任务具有挑战性,我们仍能在多个摘要和QA数据集上相对于全精度对应模型实现16.5倍的模型体积压缩比且性能下降很小。我们进一步将压缩比极限推至27.7倍,并给出了基于预训练模型的生成任务性能-效率权衡。据我们所知,这是首个旨在有效蒸馏和量化序列到序列预训练模型以用于语言生成任务的工作。
引用
@article{arxiv.2203.11239,
title = {DQ-BART: Efficient Sequence-to-Sequence Model via Joint Distillation and Quantization},
author = {Zheng Li and Zijian Wang and Ming Tan and Ramesh Nallapati and Parminder Bhatia and Andrew Arnold and Bing Xiang and Dan Roth},
journal= {arXiv preprint arXiv:2203.11239},
year = {2022}
}
备注
ACL 2022