关于注意力矩阵的解释
计算与语言
2024-10-25 v1 人工智能
摘要
本文探讨了注意力权重(AW)在变换模型中与预测输出之间可能的解释性关联。与直觉及早期注意力研究相反,更近期的先前研究提供了形式化论证和实证证据,表明AW在解释方面并不相关。我们指出,形式化论证是不正确的。我们引入并有效地计算了高效注意力,这将注意力矩阵在任务和模型中起解释作用的有效组件加以隔离。我们展示了高效注意力在需要上下文信息的NLP任务中具有因果作用(提供最小必要且充分的条件用于预测模型输出),我们还展示了与[7]相反,高效注意力矩阵是概率分布且可被有效计算。因此,它们应在解释基于注意力的模型行为方面发挥重要作用。我们提供了一系列实验支持,以证明该方法的有效性,展示了高效注意力在四个数据集上的各种属性。
引用
@article{arxiv.2410.18541,
title = {On Explaining with Attention Matrices},
author = {Omar Naim and Nicholas Asher},
journal= {arXiv preprint arXiv:2410.18541},
year = {2024}
}