SesameBERT:随处可注意
计算与语言
2019-10-09 v1 机器学习
摘要
利用预训练模型进行微调已在诸多语言任务中取得优异结果。本研究关注此类自注意力网络模型之一,即 BERT,其在多种语言理解基准的堆叠层上表现良好。然而,在许多下游任务中,BERT 在微调时忽略了层间信息。此外,尽管自注意力网络以捕捉全局依赖的能力著称,在强调局部上下文重要性方面仍有改进空间。鉴于这些优劣,本文提出 SesameBERT,一种通用微调方法,其(1)通过 Squeeze and Excitation 提取所有层间的全局信息,且(2)通过高斯模糊捕捉邻近上下文以丰富局部信息。此外,我们在 HANS 数据集上验证了方法的有效性,该数据集用于判断模型是否采用浅层启发式而非学习底层泛化。实验表明,SesameBERT 在 GLUE 基准与 HANS 评测集上均优于 BERT。
引用
@article{arxiv.1910.03176,
title = {SesameBERT: Attention for Anywhere},
author = {Ta-Chun Su and Hsiang-Chih Cheng},
journal= {arXiv preprint arXiv:1910.03176},
year = {2019}
}