通过全局探索增强局部归因的模型可解释性
机器学习
2024-08-16 v1 人工智能
摘要
在人工智能领域,AI模型常因其内部机制不透明而被描述为“黑箱”。这激发了对模型可解释性的研究兴趣,尤其是能够精确解释模型决策的归因方法。当前的归因算法通常通过探索样本空间来评估每个参数的重要性。在探索过程中会引入大量中间状态,这些状态可能到达模型的分布外(Out-of-Distribution, OOD)空间。此类中间状态会影响归因结果,使得把握特征的相对重要性变得困难。在本文中,我们首先定义了局部空间及其相关性质,并提出了利用这些性质的局部归因(Local Attribution, LA)算法。LA算法包含目标性和非目标性探索阶段,旨在有效生成能全面覆盖局部空间的归因中间状态。与最先进的归因方法相比,我们的方法在归因有效性上平均提升了38.21%。我们实验中的大量消融研究也验证了算法中每个组件的重要性。我们的代码可在以下链接获取:https://github.com/LMBTough/LA/
引用
@article{arxiv.2408.07736,
title = {Enhancing Model Interpretability with Local Attribution over Global Exploration},
author = {Zhiyu Zhu and Zhibo Jin and Jiayu Zhang and Huaming Chen},
journal= {arXiv preprint arXiv:2408.07736},
year = {2024}
}
备注
Accepted by ACMMM 2024