中文

DA-DGCEx:通过分布感知自编码器损失确保深度引导反事实解释的有效性

机器学习 2021-04-23 v3 人工智能

摘要

深度学习已成为不同领域中非常有价值的工具,无人质疑这些模型的学习能力。然而,由于深度学习模型常因其缺乏可解释性而被视为黑箱,其决策过程普遍存在不信任。为在有效性与可解释性之间取得平衡,可解释人工智能(XAI)近年日益受到关注,该领域部分方法用于生成反事实解释。生成这些解释的过程通常包含为每个待解释输入求解一个优化问题,这在需要实时反馈时不可行。为加速该过程,一些方法利用自编码器生成即时反事实解释。近期,一种称为深度引导反事实解释(DGCEx)的方法被提出,其训练一个附加于分类模型的自编码器,以生成直观的反事实解释。然而,该方法不能确保生成的反事实样本接近数据流形,从而可能生成不真实的反事实样本。为克服此问题,本文提出分布感知深度引导反事实解释(DA-DGCEx),其在DGCEx代价函数中增加一项,用以惩罚分布外反事实样本。

关键词

引用

@article{arxiv.2104.09062,
  title  = {DA-DGCEx: Ensuring Validity of Deep Guided Counterfactual Explanations With Distribution-Aware Autoencoder Loss},
  author = {Jokin Labaien and Ekhi Zugasti and Xabier De Carlos},
  journal= {arXiv preprint arXiv:2104.09062},
  year   = {2021}
}