中文

预训练 BERT 网络的彩票假设

机器学习 2020-10-20 v2 计算与语言 神经与进化计算 机器学习

摘要

在自然语言处理(NLP)中,诸如 BERT 之类的庞大预训练模型已成为训练一系列下游任务的标准起点,并且类似的趋势正在深度学习的其他领域中出现。与此同时,关于彩票假设的研究表明,用于 NLP 和计算机视觉的模型包含更小的匹配子网络,这些子网络能够独立训练至完全精度并可迁移到其他任务。在这项工作中,我们结合这些观察来评估此类可训练、可迁移的子网络是否存在于预训练的 BERT 模型中。针对一系列下游任务,我们确实在 40% 至 90% 稀疏度下找到了匹配子网络。我们在(预训练)初始化时就找到了这些子网络,这与先前 NLP 研究中它们仅在经过一定量训练后才出现的情况不同。在掩码语言建模任务(用于预训练模型的同一任务)上找到的子网络具有普遍迁移性;而在其他任务上找到的子网络即便能迁移,也仅以有限的方式迁移。随着大规模预训练日益成为深度学习的核心范式,我们的结果表明主要的彩票假设观察结果在该背景下仍然适用。代码见 https://github.com/VITA-Group/BERT-Tickets。

关键词

引用

@article{arxiv.2007.12223,
  title  = {The Lottery Ticket Hypothesis for Pre-trained BERT Networks},
  author = {Tianlong Chen and Jonathan Frankle and Shiyu Chang and Sijia Liu and Yang Zhang and Zhangyang Wang and Michael Carbin},
  journal= {arXiv preprint arXiv:2007.12223},
  year   = {2020}
}

备注

NeurIPS 2020