中文

注意力遇上扰动:基于对抗训练的高鲁棒且可解释注意力

计算与语言 2022-11-23 v2 人工智能 机器学习

摘要

尽管注意力机制已被应用于多种深度学习模型,并被证明能提升预测性能,但已有报告指出其易受机制中扰动的攻击。为克服该机制对扰动的脆弱性,我们受对抗训练(AT)的启发,AT 是一种用于增强模型鲁棒性的强大正则化技术。在本文中,我们提出一种用于自然语言处理任务的通用训练技术,包括面向注意力的对抗训练(Attention AT)和更具可解释性的面向注意力的对抗训练(Attention iAT)。所提出的技术通过利用带 AT 的机制改善了预测性能和模型可解释性。特别地,Attention iAT 通过引入对抗扰动增强了句子注意力的差异,从而提升了这些优势。在十个开放数据集上的评估实验表明,面向注意力机制的对抗训练,尤其是 Attention iAT,表现出(1)在十个任务中的九个上取得最佳性能,以及(2)对所有任务更具可解释的注意力(即所得注意力与基于梯度的重要性相关性更强)。此外,所提出的技术(3)在 AT 中对扰动大小的依赖程度低得多。我们的代码可在 https://github.com/shunk031/attention-meets-perturbation 获取。

关键词

引用

@article{arxiv.2009.12064,
  title  = {Attention Meets Perturbations: Robust and Interpretable Attention with Adversarial Training},
  author = {Shunsuke Kitada and Hitoshi Iyatomi},
  journal= {arXiv preprint arXiv:2009.12064},
  year   = {2022}
}

备注

12 pages, 4 figures. Accepted by IEEE Access on Jun. 21, 2021