易于决策,难以一致:减少显著性方法间的分歧
计算与语言
2023-05-12 v3
摘要
揭示神经 NLP 模型黑箱的一种流行方法是利用显著性方法,其为每个输入组件分配标量重要性分数。评估可解释性方法是否忠实的一个常见做法是使用一致性评估——若多种方法在解释上一致,其可信度增加。然而,近期工作发现,即便应用于同一模型实例,显著性方法也表现出较弱的秩相关,并倡导使用替代诊断方法。在我们的工作中,我们证明秩相关并不适合评估一致性,并主张 Pearson- 是更合适的替代方案。我们进一步展示,增加注意力解释忠实性的正则化技术也增加了显著性方法间的一致性。通过将我们的发现与基于训练动态的实例类别相联系,我们显示对于易学习实例,显著性方法解释的一致性非常低。最后,我们将跨实例类别一致性的提升与实例的局部表示空间统计量相联系,为分析哪些内在模型性质改善其对可解释性方法的倾向性铺平道路。
引用
@article{arxiv.2211.08369,
title = {Easy to Decide, Hard to Agree: Reducing Disagreements Between Saliency Methods},
author = {Josip Jukić and Martin Tutek and Jan Šnajder},
journal= {arXiv preprint arXiv:2211.08369},
year = {2023}
}
备注
Accepted to findings of ACL 2023