随训记笔记有助于 BERT 预训练
计算与语言
2021-03-16 v2
摘要
如何使无监督语言预训练更高效、更省资源是自然语言处理中的重要研究方向。本文聚焦于通过提供更好的数据利用来提升语言预训练方法的效率。众所周知,在语言数据语料中,词遵循重尾分布。很大比例的词仅出现极少次数,稀有词的嵌入通常优化得很差。我们认为此类嵌入携带的语义信号不足,会导致数据利用低效并拖慢整个模型的预训练。为缓解该问题,我们提出随训记笔记(TNF),在预训练过程中为稀有词随训记笔记,以助模型下次遇到它们时理解。具体而言,TNF 维护一个笔记词典,当稀有词在句中出现时将其上下文信息作为笔记保存。当同一稀有词在训练中再次出现时,先前保存的笔记信息可用于增强当前句的语义。如此,TNF 通过利用跨句信息来弥补句中稀有词导致的语义不足,从而提供更好的数据利用。我们在 BERT 与 ELECTRA 上均实现了 TNF 以检验其效率与效果。实验结果表明,在达到相同性能时,TNF 的训练时间比其骨干预训练模型少 。在相同迭代次数下训练时,TNF 在大多数下游任务与平均 GLUE 分数上均优于其骨干方法。源代码附于补充材料中。
引用
@article{arxiv.2008.01466,
title = {Taking Notes on the Fly Helps BERT Pre-training},
author = {Qiyu Wu and Chen Xing and Yatao Li and Guolin Ke and Di He and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2008.01466},
year = {2021}
}
备注
Qiyu Wu and Chen Xing contribute equally