通过干预解释隐空间
机器学习
2021-12-10 v1 计算机视觉与模式识别
摘要
深度神经网络的成功很大程度上依赖于其编码输入与输出之间复杂关系的能力。尽管这一特性有助于很好地拟合训练数据,它也掩盖了驱动预测的机制。本研究旨在通过使用一种基于离散变分自编码器的干预机制(该机制可改变预测类别)来揭示隐藏概念。随后一个解释性模型可视化来自任意隐藏层及其相应被干预表示的编码信息。通过评估原始表示与被干预表示之间的差异,人们可以确定能够改变类别的概念,从而提供可解释性。我们在 CelebA 上展示了我们方法的有效性,给出了数据中偏置的多种可视化,并提出了不同的干预以揭示和改变偏置。
引用
@article{arxiv.2112.04895,
title = {Latent Space Explanation by Intervention},
author = {Itai Gat and Guy Lorberbom and Idan Schwartz and Tamir Hazan},
journal= {arXiv preprint arXiv:2112.04895},
year = {2021}
}
备注
Accepted to AAAI22