中文

SEAT:稳定且可解释的注意力

计算与语言 2022-11-28 v1 人工智能 机器学习

摘要

当前,注意力机制已成为大多数最先进自然语言处理(NLP)模型的标准配置,不仅因其能带来卓越性能,也因其为神经架构的行为提供了看似合理的内在解释,而后者素来难以分析。然而,近期研究表明,注意力在训练或测试期间对随机性和扰动(如随机种子和嵌入向量的轻微扰动)不稳定,这阻碍了它成为可靠的释因工具。因此,一个自然的问题是:我们能否找到当前注意力的某种替代,其更稳定且能保留注意力在解释与预测上最重要的特性。本文中,为解决该问题,我们首次严格定义了此种替代,即 SEAT(稳定且可解释的注意力,Stable and Explainable Attention)。具体而言,SEAT 应具备以下三个性质:(1)其预测分布被强制接近基于原始注意力(vanilla attention)的分布;(2)其 top-k 索引与原始注意力的 top-k 索引有较大重叠;(3)其对扰动鲁棒,即 SEAT 上的任何轻微扰动都不会使预测分布改变过多,这隐含表明其对随机性和扰动稳定。最后,通过在多个数据集上的大量实验,我们使用 RNN、BiLSTM 和 BERT 架构,通过六种用于模型解释、稳定性和准确性的评估指标,将我们的 SEAT 与其他基线方法进行比较。结果表明,SEAT 对不同扰动和随机性更稳定,同时保留了注意力的可解释性,表明其是更可靠的释因。此外,与原始注意力相比,SEAT 几乎无效用(准确性)退化。

关键词

引用

@article{arxiv.2211.13290,
  title  = {SEAT: Stable and Explainable Attention},
  author = {Lijie Hu and Yixin Liu and Ninghao Liu and Mengdi Huai and Lichao Sun and Di Wang},
  journal= {arXiv preprint arXiv:2211.13290},
  year   = {2022}
}

备注

To be appeared in AAAI 2023