中文

高维数据的无模型变量重要性

机器学习 2023-04-21 v2 人工智能 机器学习

摘要

与模型无关的变量重要性方法可用于任意预测函数。这里我们提出一些不需要访问预测函数的无模型方法。当该函数是专有且不可用,或极其昂贵时,这很有用。在研究模型残差时也很有用。队列 Shapley(CS)方法是无模型的,但在输入空间维度上具有指数代价。Frye 等人(2020)提出的监督式流形上 Shapley 方法也是无模型的,但需要将第二个黑盒模型作为输入,该模型须为 Shapley 值问题训练。我们引入了队列 Shapley 的积分梯度(IG)版本,称为 IGCS,其代价为 O(nd)\mathcal{O}(nd)。我们展示了在相关单位立方体的绝大部分上,IGCS 值函数接近一个多线性函数,对此 IGCS 与 CS 匹配。IGCS 的另一个好处是允许 IG 方法用于二值预测变量。我们使用一些曲线间面积(ABC)度量来量化 IGCS 的性能。在一个来自高能物理的问题上,我们验证了 IGCS 具有与 CS 几乎相同的 ABC。我们还将其用于一个来自计算化学的 1024 变量问题。我们在那里看到 IGCS 获得的 ABC 远高于蒙特卡洛采样所得。代码公开于 https://github.com/cohortshapley/cohortintgrad。

关键词

引用

@article{arxiv.2211.08414,
  title  = {Model free variable importance for high dimensional data},
  author = {Naofumi Hama and Masayoshi Mase and Art B. Owen},
  journal= {arXiv preprint arXiv:2211.08414},
  year   = {2023}
}