这看起来像那个……真的吗?深度网络中潜空间原型可解释性的缺陷
计算机视觉与模式识别
2021-06-24 v4 人工智能
机器学习
摘要
通过架构设计产生人类可解释决策的深度神经网络,近来已成为传统黑盒模型事后解释之外日益流行的替代方案。在这些网络中,可以说最广泛的方法是所谓的原型学习,其中与所学潜原型的相似性作为对未见过的数据点进行分类的基础。在这项工作中,我们指出了此类方法的一个重要缺陷。即,潜空间中的相似性与输入空间中的相似性之间存在语义鸿沟,这可能破坏可解释性。我们设计了两个实验,在所谓的 ProtoPNet 上例证该问题。具体而言,我们发现该网络的可解释性机制可能被故意构造的甚至 JPEG 压缩伪影所误导,从而产生难以理解的决定。我们认为实践者在实践中部署基于原型的模型时应牢记这一缺陷。
引用
@article{arxiv.2105.02968,
title = {This Looks Like That... Does it? Shortcomings of Latent Space Prototype Interpretability in Deep Networks},
author = {Adrian Hoffmann and Claudio Fanconi and Rahul Rade and Jonas Kohler},
journal= {arXiv preprint arXiv:2105.02968},
year = {2021}
}