SAS:面向语言模型预训练的自增强策略
计算与语言
2023-01-12 v5 人工智能
摘要
用于语言模型预训练的自监督学习的核心包括预训练任务设计以及适当的数据增强。语言模型预训练中的大多数数据增强是与上下文无关的。ELECTRA 最近提出了一种开创性的上下文感知增强方法,通过引入一个辅助生成网络(生成器)为主判别网络(判别器)的训练产生上下文感知的数据增强,从而实现了最先进的性能。然而,该设计引入了生成器的额外计算成本,以及需要调整生成器与判别器之间相对能力的问题。在本文中,我们提出了一种自增强策略(SAS),其中单个网络被用于常规预训练以及后续轮次训练中的上下文感知数据增强。本质上,该策略消除了独立的生成器,并使用单个网络通过 MLM(掩码语言建模)和 RTD(替换词元检测)头联合执行两个预训练任务。它避免了寻找合适生成器规模的挑战,正如 ELECTRA 及其后续变体模型所证明的,这对性能至关重要。此外,SAS 是一种通用策略,可以与近期或未来出现的许多新技术(如来自 DeBERTa 的解耦注意力机制)无缝结合。我们的实验表明,SAS 能够在 GLUE 任务中以相似或更少的计算成本优于 ELECTRA 和其他最先进的模型。
引用
@article{arxiv.2106.07176,
title = {SAS: Self-Augmentation Strategy for Language Model Pre-training},
author = {Yifei Xu and Jingqiao Zhang and Ru He and Liangzhu Ge and Chao Yang and Cheng Yang and Ying Nian Wu},
journal= {arXiv preprint arXiv:2106.07176},
year = {2023}
}
备注
11 pages, 5 figures