中文

用于预训练神经网络剪枝的对齐权重正则化器

计算与语言 2022-04-06 v2 机器学习

摘要

尽管迭代剪枝已有诸多研究途径,但剪枝对零样本测试性能的影响及其对剪枝准则选择的潜在影响仍鲜为人知。该剪枝设定对跨语言模型尤为重要,此类模型在预训练期间隐式学习语言表征间的对齐,若被剪枝破坏,不仅导致在重训练所用语言数据上性能下降,在评估的零样本语言上亦如此。本工作中,我们表明在基于幅度的剪枝中,标准监督学习与时零样本设定相比存在明显的性能差异。基于此发现,我们提出两种权重正则化器,旨在最大化剪枝与未剪枝网络单元间的对齐,以减轻剪枝跨语言模型中的对齐失真,并在非零样本与零样本设定下均表现良好。我们基于 XLM-RoBERTaBase_{\mathrm{Base}} 在零样本设定的跨语言任务上给出实验结果,并发现剪枝依据零样本测试集对应语言的不同而产生不同程度的表征退化。这也是首个聚焦跨语言语言模型压缩的研究。

关键词

引用

@article{arxiv.2204.01385,
  title  = {Aligned Weight Regularizers for Pruning Pretrained Neural Networks},
  author = {James O' Neill and Sourav Dutta and Haytham Assem},
  journal= {arXiv preprint arXiv:2204.01385},
  year   = {2022}
}

备注

Accepted to ACL Findings 2022