中文

基于第一性原理的特征归因

机器学习 2025-06-02 v1

摘要

特征归因方法是解释机器学习模型行为的一种流行方法。它们为每个输入特征分配重要性分数,量化它们对模型预测的影响。然而,对这些方法进行实证评估仍然是一个重大挑战。为了规避这一缺点,先前的一些工作提出了任何特征归因方法都应满足的公理化框架。在这项工作中,我们认为这样的公理通常过于严格,并作为回应提出了一个从头构建的全新特征归因框架。我们不施加公理,而是从为最简单的模型(即指示函数)定义归因开始,并将这些作为更复杂模型的构建块。然后我们表明,根据原子归因的选择,可以恢复出几种现有的归因方法。随后,我们推导了深度ReLU网络归因的闭式表达式,并朝着基于特征归因优化评估指标迈出了一步。

关键词

引用

@article{arxiv.2505.24729,
  title  = {Feature Attribution from First Principles},
  author = {Magamed Taimeskhanov and Damien Garreau},
  journal= {arXiv preprint arXiv:2505.24729},
  year   = {2025}
}

备注

30 pages, 3 figures