深度网络中图像真实性判断模型行为解释的非可识别性
计算机视觉与模式识别
2026-04-09 v1 机器学习
摘要
深度神经网络可以预测人类判断,但这并不意味着它们依赖人类类似的信息或揭示这些判断背后的线索。先前的研究使用归因热图来解决这一问题,但这些解释本身的价值取决于其鲁棒性。这里我们通过评估预测人类真实性评分的模型是否在架构内部和跨架构之间产生一致的解释,来检验此类解释的鲁棒性。我们为多个冻结的预训练视觉模型拟合了轻量级回归头,并使用 Grad-CAM、LIME 和多尺度像素掩码生成归因图。多个架构的预测效果良好,达到了约 80% 的噪声上限。VGG 模型通过追踪图像质量而非真实性特异性方差来实现这一点,限制了其归因的相关性。在其余模型中,归因图在架构内的随机种子之间总体上是稳定的,尤其是在 EfficientNetB3 和 Barlow Twins 中,对于被判断为更真实的图像,一致性更高。关键的是,即使在预测性能相似的情况下,跨架构的归因一致性也很弱。为此,我们将模型组合成集成模型,这提高了对人类真实性判断的预测能力,并通过像素掩码实现了图像级归因。我们得出结论,虽然深度网络可以很好地预测人类真实性判断,但它们并不能为这些判断产生可识别的解释。更广泛地说,我们的发现表明,来自成功行为模型的事后解释应被视为认知机制的弱证据。
引用
@article{arxiv.2604.07254,
title = {Non-identifiability of Explanations from Model Behavior in Deep Networks of Image Authenticity Judgments},
author = {Icaro Re Depaolini and Uri Hasson},
journal= {arXiv preprint arXiv:2604.07254},
year = {2026}
}