不要相信你的眼睛:关于特征可视化的(不可)靠性
计算机视觉与模式识别
2024-06-10 v6 人工智能
人机交互
机器学习
神经元与认知
摘要
神经网络如何从像素中提取模式?特征可视化试图通过优化来可视化高激活模式,从而回答这一重要问题。如今,作为机制可解释性的一种,可视化方法构成了我们对神经网络内部运作认知的基础。在此我们追问:特征可视化有多可靠?我们着手研究,首先构建网络电路,诱使特征可视化展示出与自然输入下正常网络行为完全脱节的任意模式。随后,我们提供了标准、未被操纵的网络中出现类似现象的证据:特征可视化的处理方式与标准输入非常不同,这令人怀疑其“解释”神经网络如何处理自然图像的能力。这可用作特征可视化的健全性检查。我们以理论支撑上述实证发现,证明能够被特征可视化可靠理解的函数集合极其微小,且不包含一般的黑盒神经网络。因此,一个有前景的方向可能是开发强制特定结构的网络,以确保更可靠的特征可视化。
引用
@article{arxiv.2306.04719,
title = {Don't trust your eyes: on the (un)reliability of feature visualizations},
author = {Robert Geirhos and Roland S. Zimmermann and Blair Bilodeau and Wieland Brendel and Been Kim},
journal= {arXiv preprint arXiv:2306.04719},
year = {2024}
}
备注
ICML 2024 camera ready version