中文

通过任务无关掩码训练在BERT迁移中学习赢取彩票票

计算与语言 2022-05-31 v2

摘要

近期关于彩票票假设(LTH)的研究表明,像BERT这样的预训练语言模型(PLMs)包含匹配子网络,其迁移学习性能与原始PLM相似。这些子网络是使用基于幅度的剪枝发现的。在本文中,我们发现BERT子网络的潜力比这些研究所展示的还要大。首先,我们发现幅度剪枝的成功可归因于被保留的预训练性能,其与下游可迁移性相关。受此启发,我们提出直接针对预训练目标优化子网络结构,从而更好地保留预训练性能。具体而言,我们在预训练任务上训练模型权重上的二值掩码,旨在保留子网络的通用可迁移性,该可迁移性与任何特定下游任务无关。随后我们在GLUE基准和SQuAD数据集上微调子网络。结果表明,与幅度剪枝相比,掩码训练能有效找到在下游任务上整体性能更优的BERT子网络。此外,我们的方法在搜索子网络时也更高效,并在一定数据稀缺范围内微调时更具优势。我们的代码可在 https://github.com/llyx97/TAMT 获取。

关键词

引用

@article{arxiv.2204.11218,
  title  = {Learning to Win Lottery Tickets in BERT Transfer via Task-agnostic Mask Training},
  author = {Yuanxin Liu and Fandong Meng and Zheng Lin and Peng Fu and Yanan Cao and Weiping Wang and Jie Zhou},
  journal= {arXiv preprint arXiv:2204.11218},
  year   = {2022}
}

备注

Accepted by NAACL 2022