DecBERT:利用因果注意力掩码增强 BERT 的语言理解能力
计算与语言
2022-04-20 v1
摘要
自 2017 年以来,基于 Transformer 的模型在各种下游自然语言处理任务中发挥着关键作用。然而,Transformer 编码器所用注意力机制的一个常见局限是它无法自动捕获词序信息,因此通常需要将显式位置嵌入输入目标模型。相比之下,带有因果注意力掩码的 Transformer 解码器天然对词序敏感。在这项工作中,我们专注于利用因果注意力掩码提升 BERT 的位置编码能力。此外,我们提出了一种新的预训练语言模型 DecBERT,并在 GLUE 基准上对其进行了评估。实验结果表明:(1)因果注意力掩码对 BERT 在语言理解任务上有效;(2)我们无需位置嵌入的 DecBERT 模型在 GLUE 基准上取得了可比性能;以及(3)我们的修改加速了预训练过程,且在相同计算资源下预训练时,带位置嵌入的 DecBERT 取得了优于基线系统的整体性能。
引用
@article{arxiv.2204.08688,
title = {DecBERT: Enhancing the Language Understanding of BERT with Causal Attention Masks},
author = {Ziyang Luo and Yadong Xi and Jing Ma and Zhiwei Yang and Xiaoxi Mao and Changjie Fan and Rongsheng Zhang},
journal= {arXiv preprint arXiv:2204.08688},
year = {2022}
}
备注
NAACL-HLT 2022 Findings