中文

Latent SHAP:迈向实用的人类可解释解释

机器学习 2022-11-29 v1

摘要

模型无关特征归因算法(如 SHAP 和 LIME)是解释深度神经网络等复杂分类模型决策的通用技术。然而,由于复杂分类模型在低级(或编码)特征上训练时表现更优,许多情况下这些算法生成的解释既不可由人类解释也无法为人类所用。近期研究提出支持生成人类可解释解释的方法并不实用,因为它们需要完全可逆的变换函数将模型输入特征映射到人类可解释特征。本工作中,我们引入 Latent SHAP,一种黑盒特征归因框架,可在无需完全可逆变换函数的情况下提供人类可解释解释。我们使用(1)具有可用可逆变换函数的受控实验来稳健定量评估本方法,以及(2)名人吸引力分类(使用 CelebA 数据集)中不可逆变换函数不可用的情况来对本方法进行彻底定性评估,从而展示 Latent SHAP 的有效性。

关键词

引用

@article{arxiv.2211.14797,
  title  = {Latent SHAP: Toward Practical Human-Interpretable Explanations},
  author = {Ron Bitton and Alon Malach and Amiel Meiseles and Satoru Momiyama and Toshinori Araki and Jun Furukawa and Yuval Elovici and Asaf Shabtai},
  journal= {arXiv preprint arXiv:2211.14797},
  year   = {2022}
}