中文

利用监督变分自编码器学习不变性以实现可解释性

机器学习 2020-07-16 v1 机器学习

摘要

我们提出将学习模型不变性作为解释模型的一种手段。其动机源于逆向工程原理:若我们理解一个问题,便可以以不变性的形式在模型中引入归纳偏置;反之,在解释一个复杂的监督模型时,我们可以通过研究其不变性来理解该模型如何解决问题。为此,我们提出了一种监督形式的变分自编码器(VAE)。关键在于,潜空间中仅有一部分维度对监督任务有贡献,其余维度可作为 nuisance 参数。通过仅对 nuisance 维度进行采样,我们能够生成经历了保持分类不变之变换的样本,从而揭示模型的不变性。实验结果表明,我们所提模型在分类以及不变变换样本生成方面均具备能力。最后,我们展示了如何将本模型与特征归因方法结合,从而实现对模型决策过程更细粒度的理解。

关键词

引用

@article{arxiv.2007.07591,
  title  = {Learning Invariances for Interpretability using Supervised VAE},
  author = {An-phi Nguyen and María Rodríguez Martínez},
  journal= {arXiv preprint arXiv:2007.07591},
  year   = {2020}
}