中文

从错误中学习:将错误预测用作语言预训练中的有害警报

计算与语言 2021-12-06 v2

摘要

拟合训练数据中的复杂模式(如推理与常识)是语言预训练的关键挑战。根据近期研究及我们的经验观察,一个可能的原因是训练数据中某些易拟合的模式(如频繁共现的词组合)占据主导并损害预训练,使模型难以拟合更复杂的信息。我们认为错误预测有助于定位此类损害语言理解的主导模式。当发生错误预测时,模型中应已拟合了与错误预测词频繁共现的模式从而导致该误预测。若我们能在错误预测发生时添加正则化以训练模型更少依赖此类主导模式、更多关注其余更细微的模式,则预训练时可高效拟合更多信息。循此动机,我们提出一种新的语言预训练方法——错误预测即有害警报(MPA)。在 MPA 中,当预训练期间发生错误预测时,我们利用其共现信息引导自注意力模块的若干头。Transformer 模块中的一些自注意力头被优化为对输入句中与错误预测频繁共现的词分配较低注意力权重,而对其他词分配较高权重。如此,Transformer 模型被训练为在错误预测发生时更少依赖与误预测主导的频繁共现模式,而更多关注其余更复杂信息。实验表明 MPA 加速了 BERT 与 ELECTRA 的预训练并提升了其在下游任务上的表现。

关键词

引用

@article{arxiv.2012.08789,
  title  = {Learning from Mistakes: Using Mis-predictions as Harm Alerts in Language Pre-Training},
  author = {Chen Xing and Wenhao Liu and Caiming Xiong},
  journal= {arXiv preprint arXiv:2012.08789},
  year   = {2021}
}

备注

Accepted at SSL workshop at NeurIPS 2021