中文

可解释特征子集选择:一种基于 Shapley 值的方法

机器学习 2021-04-27 v3 机器学习

摘要

针对特征选择及相关问题,我们引入分类博弈这一合作博弈的概念,以特征为局中人、基于 hinge 损失的特征函数,并将特征的贡献关联到基于 Shapley 值的总训练误差分摊(SVEA)。我们的主要贡献是(\star)证明对任意数据集,SVEA 值上的阈值 0 可识别出联合交互对标签预测显著的特征子集,或识别出数据主要所处的子空间所张成的那些特征。此外,我们的方案(\star)识别出贝叶斯分类器不依赖但任何基于替代损失函数的有限样本分类器所依赖的特征;这导致了此类分类器的额外 00-11 风险,(\star)估计特征的未知真实 hinge 风险,以及(\star)通过设计分类博弈核心的类似物,将分配的稳定性性质与负值的 SVEA 相关联。由于 Shapley 值计算代价高昂,我们基于一种已知的蒙特卡洛近似算法,该算法仅在需要时计算特征函数(线性规划)。我们通过为多个子样本获得的 SVEA 值提供区间估计,解决特征选择中潜在的样本偏差问题。我们在多个合成与真实数据集上展示了上述所有方面,并表明我们的方案在大多数情况下优于现有的递归特征消除技术与 ReliefF。我们以定义良好的特征函数为基础、理论上严谨的分类博弈,为我们的框架提供了可解释性(我们按最终任务形式化)与可说明性,包括重要特征的识别。

关键词

引用

@article{arxiv.2001.03956,
  title  = {Interpretable feature subset selection: A Shapley value based approach},
  author = {Sandhya Tripathi and N. Hemachandra and Prashant Trivedi},
  journal= {arXiv preprint arXiv:2001.03956},
  year   = {2021}
}

备注

A shorter version of this work appeared in a special session titled Explainable AI at IEEE BigData'20 conference. More experiments and a new notion of interpretable FSS introduced in this version. Earlier plots for sample bias robustness are corrected and updated