中文

基于移除的特征归因的鲁棒性研究

机器学习 2023-11-01 v2 机器学习

摘要

为解释复杂机器学习模型所做的预测,已开发出许多为特征分配重要性分数的特征归因方法。一些近期工作通过表明这些方法对输入与模型扰动敏感而质疑其鲁棒性,而其他工作则通过提出鲁棒归因方法来解决该问题。然而,先前关于归因鲁棒性的工作主要关注基于梯度的特征归因,而基于移除的归因方法的鲁棒性目前尚不清楚。为弥补这一空白,我们从理论上刻画了基于移除的特征归因的鲁棒性性质。具体而言,我们对这类方法给出统一分析,并在输入与模型扰动两种设定下推导完好与扰动归因之间差异的上界。我们在合成与真实数据上的实证结果验证了理论结果并展示了其实际意义,包括通过改善模型的 Lipschitz 正则性来提升归因鲁棒性。

关键词

引用

@article{arxiv.2306.07462,
  title  = {On the Robustness of Removal-Based Feature Attributions},
  author = {Chris Lin and Ian Covert and Su-In Lee},
  journal= {arXiv preprint arXiv:2306.07462},
  year   = {2023}
}

备注

NeurIPS camera-ready version