基于第一性原理的特征归因
机器学习
2025-06-02 v1
摘要
特征归因方法是解释机器学习模型行为的一种流行方法。它们为每个输入特征分配重要性分数,量化它们对模型预测的影响。然而,对这些方法进行实证评估仍然是一个重大挑战。为了规避这一缺点,先前的一些工作提出了任何特征归因方法都应满足的公理化框架。在这项工作中,我们认为这样的公理通常过于严格,并作为回应提出了一个从头构建的全新特征归因框架。我们不施加公理,而是从为最简单的模型(即指示函数)定义归因开始,并将这些作为更复杂模型的构建块。然后我们表明,根据原子归因的选择,可以恢复出几种现有的归因方法。随后,我们推导了深度ReLU网络归因的闭式表达式,并朝着基于特征归因优化评估指标迈出了一步。
引用
@article{arxiv.2505.24729,
title = {Feature Attribution from First Principles},
author = {Magamed Taimeskhanov and Damien Garreau},
journal= {arXiv preprint arXiv:2505.24729},
year = {2025}
}
备注
30 pages, 3 figures