中文

预训练语言模型中的超级票:从模型压缩到提升泛化能力

机器学习 2021-06-09 v2 计算与语言

摘要

彩票假设认为,过参数化网络由“彩票”组成,训练其中特定集合(即子网络)可匹配完整模型的性能。本文研究此类票的集合,称为“中奖票”,存在于极度过参数化模型中,例如预训练语言模型。我们观察到在特定压缩比下,中奖票的泛化性能不仅能匹配还可超越完整模型。特别地,我们观察到相变现象:随着压缩比增大,中奖票的泛化性能先提升后在某一阈值后退化。我们将阈值处的票称为“超级票”。我们进一步表明该相变依赖于任务和模型——模型规模越大、训练数据集越小,相变越显著。我们在GLUE基准上的实验表明,超级票在任务平均得分上使单任务微调在BERT-base上提升0.90.9点、在BERT-large上提升1.01.0点。我们还展示了跨任务自适应共享超级票有益于多任务学习。

关键词

引用

@article{arxiv.2105.12002,
  title  = {Super Tickets in Pre-Trained Language Models: From Model Compression to Improving Generalization},
  author = {Chen Liang and Simiao Zuo and Minshuo Chen and Haoming Jiang and Xiaodong Liu and Pengcheng He and Tuo Zhao and Weizhu Chen},
  journal= {arXiv preprint arXiv:2105.12002},
  year   = {2021}
}

备注

The 59th annual meeting of the Association for Computational Linguistics (ACL 2021)