中文

学习为 ELECTRA 预训练采样替换词

计算与语言 2021-06-28 v1

摘要

ELECTRA 预训练一个判别器来检测被替换的 token,其中替换词从一个以掩码语言建模训练的生成器中采样。尽管性能引人注目,ELECTRA 存在以下两个问题。首先,从判别器到生成器没有直接的反馈回路,这使得替换词采样低效。其次,生成器的预测随训练趋于过度自信,使得替换词偏向正确 token。在本文中,我们提出两种方法来改进 ELECTRA 预训练的替换词采样。具体而言,我们用难度预测机制增强采样,使生成器能鼓励判别器学习其尚未掌握的内容。我们还证明了高效采样降低了判别器的训练方差。此外,我们提出对生成器使用 focal loss,以缓解将正确 token 过度采样为替换词。实验结果表明,我们的方法在各种下游任务上改进了 ELECTRA 预训练。

关键词

引用

@article{arxiv.2106.13715,
  title  = {Learning to Sample Replacements for ELECTRA Pre-Training},
  author = {Yaru Hao and Li Dong and Hangbo Bao and Ke Xu and Furu Wei},
  journal= {arXiv preprint arXiv:2106.13715},
  year   = {2021}
}

备注

Accepted by Findings of ACL 2021