中文

并非所有注意力都不可或缺

计算与语言 2021-06-02 v3

摘要

尽管预训练语言模型(PrLMs)在近年自然语言处理中取得了成功,但其庞大的模型规模易致过拟合。为此,dropout 成为一种应对手段。然而,现有的基于随机、基于知识和基于搜索的 dropout 方法较为通用,对作为 PrLMs 基础架构被广泛采用的基于自注意力模型效果欠佳。本文提出一种名为 AttendOut 的新型 dropout 方法,使基于自注意力的 PrLMs 能够进行更鲁棒的任务特定微调。我们证明,具备精细训练设计的最先进模型可取得远更强的结果。我们在广泛的自然语言处理任务上验证了方法的普适性。

关键词

引用

@article{arxiv.2104.04692,
  title  = {Not All Attention Is All You Need},
  author = {Hongqiu Wu and Hai Zhao and Min Zhang},
  journal= {arXiv preprint arXiv:2104.04692},
  year   = {2021}
}