基于一致性属性的双层嵌套特征归因解释黑箱模型预测
机器学习
2025-05-26 v2 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
解释黑箱机器学习模型预测的技术方法对于增加AI系统信任至关重要。模型的输入特征常具有嵌套结构,包含高层特征和低层特征,其中每个高层特征分解为多个低层特征。对于此类输入,高层特征归因(HiFAs)和低层特征归因(LoFAs)都对更好地理解模型决策至关重要。本文提出一种模型中性的局部解释方法,有效地利用输入的嵌套结构同时估计双层特征归因。提出的方法的关键思想是引入一种应存在于HiFAs和LoFAs之间的一致性属性,从而桥接估计它们的独立优化问题。由于这种一致性属性,本方法能够产生既对黑箱模型忠实且与之一致的HiFAs和LoFAs,同时使用更少的查询次数。我们在图像分类中的多实例学习和使用语言模型的文本分类实验中表明,本方法估计的HiFAs和LoFAs在准确性、对黑箱模型行为的忠实度方面均表现出色,并提供了一致的解释。
引用
@article{arxiv.2405.14522,
title = {Explaining Black-box Model Predictions via Two-level Nested Feature Attributions with Consistency Property},
author = {Yuya Yoshikawa and Masanari Kimura and Ryotaro Shimizu and Yuki Saito},
journal= {arXiv preprint arXiv:2405.14522},
year = {2025}
}
备注
This manuscript is an extended version of our paper accepted at IJCAI2025, with detailed proofs and additional experimental results