用于解释模型预测的非对称特征交互
计算与语言
2023-10-27 v4
摘要
在自然语言处理(NLP)中,深度神经网络(DNN)能够建模上下文之间的复杂交互,并在一系列 NLP 任务上取得令人印象深刻的成果。先前关于特征交互归因的工作主要聚焦于研究对称交互,仅解释一组词组合时的额外影响,无法捕捉对模型预测有贡献的非对称影响。本工作中,我们提出一种非对称特征交互归因解释模型,旨在探索深度神经 NLP 模型推理中的非对称高阶特征交互。通过用有向交互图表示我们的解释,我们经实验证明了该图在发现非对称特征交互上的可解释性。在两个情感分类数据集上的实验结果表明,相较于最先进(SOTA)的特征交互归因方法,我们的模型在识别对模型预测有影响力的特征方面具有优越性。我们的代码可在 https://github.com/StillLu/ASIV 获取。
引用
@article{arxiv.2305.07224,
title = {Asymmetric feature interaction for interpreting model predictions},
author = {Xiaolei Lu and Jianghong Ma and Haode Zhang},
journal= {arXiv preprint arXiv:2305.07224},
year = {2023}
}
备注
Accepted by Findings of the Association for Computational Linguistics: ACL 2023 (long paper)