ELECTRA同样是一个零样本学习器
计算与语言
2022-07-21 v2
摘要
近来,在少样本甚至零样本学习中,相较于“预训练、微调”范式,新范式“预训练、提示、预测”取得了显著成就。在基于提示的GPT-3取得成功之后,一系列基于掩码语言模型(MLM)(如BERT、RoBERTa)的提示学习方法流行并被广泛使用。然而,另一种高效的预训练判别模型ELECTRA可能已被忽视。本文中,我们尝试使用我们提出的基于替换词检测(RTD)的新型提示学习方法,在零样本场景下完成若干NLP任务。实验结果表明,基于RTD提示学习的ELECTRA模型取得了令人惊讶的最先进零样本性能。数值上,与MLM-RoBERTa-large和MLM-BERT-large相比,我们的RTD-ELECTRA-large在所有15项任务上平均提升约8.4%和13.7%。尤其在SST-2任务上,我们的RTD-ELECTRA-large在无任何训练数据的情况下达到了惊人的90.1%准确率。总体而言,与预训练掩码语言模型相比,预训练替换词检测模型在零样本学习中表现更优。源代码见:https://github.com/nishiwen1214/RTD-ELECTRA。
引用
@article{arxiv.2207.08141,
title = {ELECTRA is a Zero-Shot Learner, Too},
author = {Shiwen Ni and Hung-Yu Kao},
journal= {arXiv preprint arXiv:2207.08141},
year = {2022}
}
备注
The source code is available at: https://github.com/nishiwen1214/RTD-ELECTRA