中文

使用深度模型反演设计反事实生成器

机器学习 2021-10-06 v2 计算机视觉与模式识别

摘要

合成对给定图像进行微小、可解释的改变,同时在模型预测中产生预期变化的技术,已成为内省黑盒模型的流行方法。这些合成的解释通常被称为反事实,要求包含可辨识的变化(以便于解释),同时具有真实性(与数据流形保持一致)。在本文中,我们关注只能访问已训练的深度分类器而无法获取实际训练数据的情况。虽然反演深度模型以从训练分布中合成图像的问题已被探索,但我们的目标是开发一种深度反演方法,为给定的查询图像生成反事实解释。尽管现有的深度反演方法在条件图像合成方面很有效,但我们表明它们不足以产生有意义的反事实。我们提出了DISC(Deep Inversion for Synthesizing Counterfactuals),通过利用更强的图像先验、引入新颖的流形一致性目标以及采用渐进式优化策略来改进深度反演。我们发现,DISC生成的反事实除了能产生视觉上有意义的解释外,还能有效学习分类器决策边界,并且对未知的测试时损坏具有鲁棒性。

关键词

引用

@article{arxiv.2109.14274,
  title  = {Designing Counterfactual Generators using Deep Model Inversion},
  author = {Jayaraman J. Thiagarajan and Vivek Narayanaswamy and Deepta Rajan and Jason Liang and Akshay Chaudhari and Andreas Spanias},
  journal= {arXiv preprint arXiv:2109.14274},
  year   = {2021}
}

备注

Neurips 2021