AttributionLab:可控环境下特征归因的忠实性
机器学习
2024-02-15 v2
摘要
特征归因通过识别相关输入特征来解释神经网络输出。归因必须是忠实的,即被归因的特征必须反映影响输出的输入特征。近期检验忠实性的一种趋势是在具有已知相关特征的设计数据上拟合模型,然后将归因与真实输入特征进行比较。该思路假设模型学会使用且仅使用这些设计特征,但这一点无法保证。在本文中,我们通过设计网络并手动设定其权重,同时设计数据,解决了此问题。该设置称为 AttributionLab,可作为忠实性的健全性检验:若某归因方法在受控环境中不忠实,则在真实场景中可能不可靠。该环境亦可作为受控实验的实验室,借此我们分析归因方法并提出改进建议。
引用
@article{arxiv.2310.06514,
title = {AttributionLab: Faithfulness of Feature Attribution Under Controllable Environments},
author = {Yang Zhang and Yawei Li and Hannah Brown and Mina Rezaei and Bernd Bischl and Philip Torr and Ashkan Khakzar and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2310.06514},
year = {2024}
}
备注
Appear at NeurIPS 2023 Workshop XAIA