中文

更多关注自注意力:通过注意力引导改进预训练语言模型

计算与语言 2022-04-07 v1

摘要

预训练语言模型(PLM)已证明其在广泛的信息检索与自然语言处理任务中的有效性。作为PLM的核心部分,多头自注意力因其能够联合关注来自不同位置的信息而颇具吸引力。然而,研究人员发现PLM无论输入如何总是表现出固定的注意力模式(例如,过度关注[CLS]或[SEP]),我们认为这可能会忽略其他位置的重要信息。在这项工作中,我们提出一种简单而有效的注意力引导机制,通过鼓励注意力朝向既定目标来提升PLM的性能。具体而言,我们提出两种注意力引导方法,即映射判别引导(MDG)和注意力模式去相关引导(PDG)。前者明确鼓励多个自注意力头之间的多样性以联合关注来自不同表示子空间的信息,而后者鼓励自注意力尽可能关注输入中尽可能多的不同位置。我们使用多个通用预训练模型(即BERT、ALBERT和Roberta)和领域特定预训练模型(即BioBERT、ClinicalBERT、BlueBert和SciBERT)在三个基准数据集(即MultiNLI、MedNLI和Cross-genre-IR)上进行实验。大量实验结果表明,我们提出的MDG和PDG在所有数据集上以高效率、低成本带来了稳定的性能提升。

关键词

引用

@article{arxiv.2204.02922,
  title  = {Paying More Attention to Self-attention: Improving Pre-trained Language Models via Attention Guiding},
  author = {Shanshan Wang and Zhumin Chen and Zhaochun Ren and Huasheng Liang and Qiang Yan and Pengjie Ren},
  journal= {arXiv preprint arXiv:2204.02922},
  year   = {2022}
}