从特征可视化到视觉电路:对抗性模型操纵的影响
计算机视觉与模式识别
2024-06-04 v1 密码学与安全
机器学习
摘要
理解大规模深度神经网络的内部工作机制具有挑战性,但在多个高风险应用中至关重要。机械可解释性是一个新兴领域,通过识别深度神经网络中人类可理解的子图(称为电路)来应对这一挑战。在视觉预训练模型中,这些子图通常通过一种称为特征可视化的流行技术来可视化其节点特征。最近的工作分析了不同特征可视化类型在对抗性模型操纵框架下的稳定性。本文首先通过提出一种名为ProxPulse的新攻击来解决现有工作的局限性,该攻击同时操纵两种类型的特征可视化。令人惊讶的是,当在视觉电路的框架下分析这些攻击时,我们发现视觉电路对ProxPulse表现出一定的鲁棒性。因此,我们引入了一种基于ProxPulse的新攻击,揭示了视觉电路的可操纵性,揭示了其缺乏鲁棒性。使用预训练的AlexNet和ResNet-50模型在ImageNet上验证了这些攻击的有效性。
引用
@article{arxiv.2406.01365,
title = {From Feature Visualization to Visual Circuits: Effect of Adversarial Model Manipulation},
author = {Geraldin Nanfack and Michael Eickenberg and Eugene Belilovsky},
journal= {arXiv preprint arXiv:2406.01365},
year = {2024}
}
备注
Under review