学习为 ELECTRA 预训练采样替换词
计算与语言
2021-06-28 v1
摘要
ELECTRA 预训练一个判别器来检测被替换的 token,其中替换词从一个以掩码语言建模训练的生成器中采样。尽管性能引人注目,ELECTRA 存在以下两个问题。首先,从判别器到生成器没有直接的反馈回路,这使得替换词采样低效。其次,生成器的预测随训练趋于过度自信,使得替换词偏向正确 token。在本文中,我们提出两种方法来改进 ELECTRA 预训练的替换词采样。具体而言,我们用难度预测机制增强采样,使生成器能鼓励判别器学习其尚未掌握的内容。我们还证明了高效采样降低了判别器的训练方差。此外,我们提出对生成器使用 focal loss,以缓解将正确 token 过度采样为替换词。实验结果表明,我们的方法在各种下游任务上改进了 ELECTRA 预训练。
引用
@article{arxiv.2106.13715,
title = {Learning to Sample Replacements for ELECTRA Pre-Training},
author = {Yaru Hao and Li Dong and Hangbo Bao and Ke Xu and Furu Wei},
journal= {arXiv preprint arXiv:2106.13715},
year = {2021}
}
备注
Accepted by Findings of ACL 2021