中文

基于多词选择的 ELECTRA 增强训练

计算与语言 2022-03-04 v2

摘要

诸如 BERT 及其变体等预训练文本编码器近期在许多 NLP 任务上取得了最先进的性能。尽管有效,这些预训练方法通常需要海量计算资源。为加速预训练,ELECTRA 训练一个判别器来预测每个输入词元是否被生成器替换。然而,这一新任务作为二分类问题,语义信息较少。本研究中,我们提出一种基于多任务学习改进 ELECTRA 的新文本编码器预训练方法。具体而言,我们训练判别器同时检测被替换词元并从候选集中选择原始词元。我们进一步开发了两种技术以有效结合所有预训练任务:(1)对任务特定头使用基于注意力的网络,(2)共享生成器与判别器的底层。在 GLUE 和 SQuAD 数据集上的大量实验证明了我们所提方法的有效性与高效性。

关键词

引用

@article{arxiv.2106.00139,
  title  = {Training ELECTRA Augmented with Multi-word Selection},
  author = {Jiaming Shen and Jialu Liu and Tianqi Liu and Cong Yu and Jiawei Han},
  journal= {arXiv preprint arXiv:2106.00139},
  year   = {2022}
}

备注

Accepted in Findings of ACL 2021