基于真负样本的语言模型预训练
计算与语言
2022-12-02 v1
摘要
判别式预训练语言模型(PLM)学习从故意损坏的文本中预测原始文本。将前者作为正样本、后者作为负样本,PLM可有效训练以获得上下文表示。然而,此类PLM的训练高度依赖于自动构建样本的质量。现有PLM简单地将所有损坏文本视为等同负样本而不加甄别,这实际使所得模型不可避免地遭受伪负样本问题——即在伪负数据上开展训练,并导致所得PLM效率与鲁棒性下降。本工作中,在界定了长期被忽视的判别式PLM中的伪负样本问题的基础上,我们设计了增强的预训练方法,通过纠正受伪负预测影响的有害梯度更新来抵消伪负预测,并鼓励在真负样本上预训练语言模型。在GLUE和SQuAD基准上的实验结果表明,我们的反伪负预训练方法确实带来了更优的性能以及更强的鲁棒性。
引用
@article{arxiv.2212.00460,
title = {Language Model Pre-training on True Negatives},
author = {Zhuosheng Zhang and Hai Zhao and Masao Utiyama and Eiichiro Sumita},
journal= {arXiv preprint arXiv:2212.00460},
year = {2022}
}
备注
Accepted by AAAI 2023