中文

通过判别训练分类器的前馈反演理解不变性

机器学习 2021-07-23 v2

摘要

如果一个判别训练的神经网络分类器在输出层之前已丢弃除类别归属以外的所有关于输入的信息,它就能完美拟合训练数据。令人惊讶的是,过去的研究发现一些无关的视觉细节仍保留在 logit 向量中。这一发现基于将深层嵌入映射回图像的反演技术。我们进一步利用一种新颖的方法综合来探索这一现象,得到了一个前馈反演模型,其生成的重建保真度极高,在质量上优于过去的努力。当应用于对抗鲁棒分类器模型时,重建中包含足够的局部细节和全局结构,在匆匆一瞥中可能与原图混淆,且物体类别可从重建中清晰辨认。我们的方法基于 BigGAN (Brock, 2019),以 logits 而非独热类标签为条件。我们将重建模型作为探索表示性质的工具,包括:模型架构和训练目标(特别是鲁棒损失)的影响、网络所实现的不变性形式、正确与错误分类图像之间的表示差异,以及操纵 logits 和图像的效果。我们相信我们的方法能启发未来对神经网络中信息流本质的研究,并可为改进判别模型提供诊断。

关键词

引用

@article{arxiv.2103.07470,
  title  = {Understanding Invariance via Feedforward Inversion of Discriminatively Trained Classifiers},
  author = {Piotr Teterwak and Chiyuan Zhang and Dilip Krishnan and Michael C. Mozer},
  journal= {arXiv preprint arXiv:2103.07470},
  year   = {2021}
}

备注

Camera Ready ICML 2021