面向大规模商业回复建议的低成本 Transformer 模型压缩探索
计算与语言
2021-11-30 v1
摘要
微调预训练语言模型提升了商业回复建议系统的质量,但代价是难以持续的训练时间。流行的训练时间缩减方法资源消耗大,因此我们探索了如层丢弃(Layer Dropping)和层冻结(Layer Freezing)等低成本模型压缩技术。我们展示了这些技术在大数据场景下的有效性,使商业邮件回复建议系统的训练时间减少 42%,且不影响模型相关性或用户参与度。我们进一步研究了这些技术对预训练模型和数据集规模消融的鲁棒性,并分享了针对商业应用的若干见解与建议。
引用
@article{arxiv.2111.13999,
title = {Exploring Low-Cost Transformer Model Compression for Large-Scale Commercial Reply Suggestions},
author = {Vaishnavi Shrivastava and Radhika Gaonkar and Shashank Gupta and Abhishek Jha},
journal= {arXiv preprint arXiv:2111.13999},
year = {2021}
}