通过虚拟对抗训练使注意力机制更鲁棒且更具可解释性
计算与语言
2022-12-27 v3 人工智能
摘要
尽管注意力机制已成为深度学习模型的基本组件,但它们易受扰动影响,这可能降低预测性能与模型可解释性。针对注意力机制的对抗训练(AT)通过考虑对抗扰动成功减少了此类缺陷。然而,该技术需要标签信息,因此其使用限于监督设定。在本研究中,我们探索将虚拟对抗训练(VAT)引入注意力机制的概念,借此即使从无标签数据中也能计算对抗扰动。为实现该方法,我们提出两种通用训练技术,即面向注意力机制的 VAT(Attention VAT)与面向注意力机制的“可解释”VAT(Attention iVAT),它们将面向注意力机制的 AT 扩展至半监督设定。特别地,Attention iVAT 关注注意力之间的差异;因此,即使使用无标签数据,它也能高效学习更清晰的注意力并提升模型可解释性。基于六个公开数据集的实证实验表明,我们的技术比传统的基于 AT 以及基于 VAT 的技术提供了更好的预测性能,并与人类在句子中检测重要词所提供的证据具有更强的一致性。此外,我们的方案无需额外精心选择无标签数据即可带来这些优势。也就是说,即使使用我们基于 VAT 技术的模型在来自目标任务之外来源的无标签数据上训练,预测性能与模型可解释性也能得到提升。
引用
@article{arxiv.2104.08763,
title = {Making Attention Mechanisms More Robust and Interpretable with Virtual Adversarial Training},
author = {Shunsuke Kitada and Hitoshi Iyatomi},
journal= {arXiv preprint arXiv:2104.08763},
year = {2022}
}
备注
18 pages, 3 figures. Accepted for publication in Springer Applied Intelligence (APIN)