中文

PLATON:基于权重重要性上置信界的大Transformer模型剪枝

机器学习 2022-06-28 v1

摘要

基于大型Transformer的模型在各种自然语言处理与计算机视觉任务中展现出了优越的性能。然而,这些模型包含海量参数,限制了它们在现实应用中的部署。为减小模型规模,研究者依据权重的重要性分数对这些模型进行剪枝。然而,此类分数通常在训练期间基于小批量(mini-batch)估计,由于小批量采样与复杂的训练动态而带来较大的变异性/不确定性。因此,一些关键权重可能因该不确定性而被常用剪枝方法剪除,导致训练不稳定并损害泛化能力。为解决此问题,我们提出PLATON,其通过重要性估计的上置信界(UCB)来捕捉重要性分数的不确定性。具体而言,对于重要性分数低但不确定性高的权重,PLATON倾向于保留它们并挖掘其能力。我们在自然语言理解、问答与图像分类任务上基于多个Transformer模型进行了大量实验以验证PLATON的有效性。结果表明,PLATON在不同稀疏度水平下均表现出显著提升。我们的代码已公开于 https://github.com/QingruZhang/PLATON。

关键词

引用

@article{arxiv.2206.12562,
  title  = {PLATON: Pruning Large Transformer Models with Upper Confidence Bound of Weight Importance},
  author = {Qingru Zhang and Simiao Zuo and Chen Liang and Alexander Bukharin and Pengcheng He and Weizhu Chen and Tuo Zhao},
  journal= {arXiv preprint arXiv:2206.12562},
  year   = {2022}
}

备注

Proceedings of the 39th International Conference on Machine Learning (ICML 2022)