中文

无不可能数据的变量重要性

机器学习 2023-04-14 v3 人工智能 计量经济学 机器学习

摘要

衡量黑盒预测算法中变量重要性的最流行方法利用了合成输入,这些输入组合了多个主体的预测变量。这些输入可能不太可能、物理上不可能、甚至逻辑上不可能。因此,此类情况下的预测可能基于与黑盒训练数据截然不同的数据。我们认为,当解释使用了此类取值时,用户无法信任对预测算法决策的解释。相反,我们提倡一种称为 Cohort Shapley 的方法,该方法植根于经济博弈论,且与大多数其他博弈论方法不同,它仅使用实际观测数据来量化变量重要性。Cohort Shapley 通过缩小在一项或多项特征上判定为类似于目标主体的主体队列来工作。我们在一个算法公平性问题上进行说明,其中将重要性归因于模型未训练过的受保护变量至关重要。

关键词

引用

@article{arxiv.2205.15750,
  title  = {Variable importance without impossible data},
  author = {Masayoshi Mase and Art B. Owen and Benjamin B. Seiler},
  journal= {arXiv preprint arXiv:2205.15750},
  year   = {2023}
}