中文

基于残差注意力去偏的鲁棒自然语言理解

计算与语言 2023-05-30 v1 人工智能 机器学习

摘要

自然语言理解(NLU)模型常常受到非预期的数据集偏置影响。在偏置缓解方法中,基于集成的去偏方法,尤其是专家乘积(PoE),因其令人瞩目的实证效果而脱颖而出。然而,以往基于集成的去偏方法通常仅在顶层 logits 上施加去偏,而未直接处理有偏的注意力模式。注意力是预训练语言模型(PLM)中特征交互与聚合的主要媒介,并在提供鲁棒预测方面发挥着关键作用。本文提出 REsidual Attention Debiasing(READ),一种端到端的从注意力中缓解非预期偏置的去偏方法。在三个 NLU 任务上的实验表明,READ 显著提升了基于 BERT 的模型在去除捷径的 OOD 数据上的性能,包括在 HANS 上准确率提升 12.9%、在 FEVER-Symmetric 上准确率提升 11.0%、在 PAWS 上 F1 提升 2.7%。详细分析展示了无偏注意力在鲁棒 NLU 模型中的关键作用,以及 READ 能有效缓解注意力中的偏置。代码见 https://github.com/luka-group/READ。

关键词

引用

@article{arxiv.2305.17627,
  title  = {Robust Natural Language Understanding with Residual Attention Debiasing},
  author = {Fei Wang and James Y. Huang and Tianyi Yan and Wenxuan Zhou and Muhao Chen},
  journal= {arXiv preprint arXiv:2305.17627},
  year   = {2023}
}

备注

ACL 2023 Findings