通过以人为基准的实验协议评估自注意力可解释性
机器学习
2023-03-28 v1 计算与语言
摘要
注意力机制在诸如自然语言处理中 Transformer 等复杂架构的发展中起到了关键作用。然而,Transformer 仍难以解释,并被视为黑箱。本文旨在评估 Transformer 的注意力系数如何在提供可解释性方面发挥作用。提出了一种称为 CLaSsification-Attention (CLS-A) 的基于注意力的可解释性新方法。CLS-A 基于与 Transformer 架构中分类任务特定部分相关的注意力系数分布,为每个词计算可解释性分数。开展了一项以人为基准的实验,以评估 CLS-A 并与其他可解释性方法比较。该实验协议依赖于可解释性方法提供与人类推理一致的解释的能力。实验设计包括测量人类受试者的反应时间与正确响应率。就参与者的平均反应时间与准确率而言,CLS-A 的表现与常用可解释性方法相当。CLS-A 相较于其他可解释性方法更低的计算成本,以及其在分类器中按设计即可获得的特点,使其尤为有趣。数据分析还凸显了分类器预测的概率分数与恰当解释之间的联系。最后,我们的工作确认了使用 CLS-A 的合理性,并展示了自注意力在多大程度上包含用于解释 Transformer 分类器的丰富信息。
引用
@article{arxiv.2303.15190,
title = {Evaluating self-attention interpretability through human-grounded experimental protocol},
author = {Milan Bhan and Nina Achache and Victor Legrand and Annabelle Blangero and Nicolas Chesneau},
journal= {arXiv preprint arXiv:2303.15190},
year = {2023}
}
备注
11 pages, 7 figures