并非所有注意力都不可或缺
计算与语言
2021-06-02 v3
摘要
尽管预训练语言模型(PrLMs)在近年自然语言处理中取得了成功,但其庞大的模型规模易致过拟合。为此,dropout 成为一种应对手段。然而,现有的基于随机、基于知识和基于搜索的 dropout 方法较为通用,对作为 PrLMs 基础架构被广泛采用的基于自注意力模型效果欠佳。本文提出一种名为 AttendOut 的新型 dropout 方法,使基于自注意力的 PrLMs 能够进行更鲁棒的任务特定微调。我们证明,具备精细训练设计的最先进模型可取得远更强的结果。我们在广泛的自然语言处理任务上验证了方法的普适性。
引用
@article{arxiv.2104.04692,
title = {Not All Attention Is All You Need},
author = {Hongqiu Wu and Hai Zhao and Min Zhang},
journal= {arXiv preprint arXiv:2104.04692},
year = {2021}
}