基于损失梯度的可解释性方法中的异常行为
机器学习
2022-07-19 v1 人工智能
信息检索
摘要
损失梯度被用于解释深度学习模型的决策过程。在本工作中,我们通过遮挡输入的部分内容并将遮挡后输入与原输入的性能进行比较,来评估基于损失梯度的归因方法。我们观察到在某些条件下,遮挡后输入在整个测试数据集上的性能优于原输入。在声音与图像识别任务中均观察到类似行为。我们探究了不同的损失梯度归因方法、遮挡程度与替换值,以解释遮挡下性能提升的现象。
引用
@article{arxiv.2207.07769,
title = {Anomalous behaviour in loss-gradient based interpretability methods},
author = {Vinod Subramanian and Siddharth Gururani and Emmanouil Benetos and Mark Sandler},
journal= {arXiv preprint arXiv:2207.07769},
year = {2022}
}
备注
Accepted at ICLR RobustML workshop 2021