基于多词选择的 ELECTRA 增强训练
计算与语言
2022-03-04 v2
摘要
诸如 BERT 及其变体等预训练文本编码器近期在许多 NLP 任务上取得了最先进的性能。尽管有效,这些预训练方法通常需要海量计算资源。为加速预训练,ELECTRA 训练一个判别器来预测每个输入词元是否被生成器替换。然而,这一新任务作为二分类问题,语义信息较少。本研究中,我们提出一种基于多任务学习改进 ELECTRA 的新文本编码器预训练方法。具体而言,我们训练判别器同时检测被替换词元并从候选集中选择原始词元。我们进一步开发了两种技术以有效结合所有预训练任务:(1)对任务特定头使用基于注意力的网络,(2)共享生成器与判别器的底层。在 GLUE 和 SQuAD 数据集上的大量实验证明了我们所提方法的有效性与高效性。
引用
@article{arxiv.2106.00139,
title = {Training ELECTRA Augmented with Multi-word Selection},
author = {Jiaming Shen and Jialu Liu and Tianqi Liu and Cong Yu and Jiawei Han},
journal= {arXiv preprint arXiv:2106.00139},
year = {2022}
}
备注
Accepted in Findings of ACL 2021