神经网络中的精确特征碰撞
机器学习
2022-06-01 v1
摘要
深度神经网络的预测已被证明对输入空间中微小变化高度敏感,此类含小扰动的恶意构造数据点被称为对抗样本。另一方面,近期研究表明,同样的网络也可能对大幅变化极度不敏感,两个差异巨大的数据点的预测可被映射到近似相同的输出。此类情况下,两个数据点的特征被称为近似碰撞,从而导致高度相似的预测。我们的结果改进并扩展了 Li 等人(2019)的工作,从神经网络权重的视角为具有共谋特征的数据点奠定理论基础,揭示神经网络不仅受近似碰撞特征之困,亦受精确碰撞特征之扰。我们确定了此类情形存在的必要条件,并据此考察了大量用于解决各类计算机视觉问题的 DNN。此外,我们提出零空间搜索(Null-space search),一种不依赖启发式的数值方法,可为任意输入与任意任务(包括但不限于分类、定位与分割)创建具碰撞特征的数据点。
引用
@article{arxiv.2205.15763,
title = {Exact Feature Collisions in Neural Networks},
author = {Utku Ozbulak and Manvel Gasparyan and Shodhan Rao and Wesley De Neve and Arnout Van Messem},
journal= {arXiv preprint arXiv:2205.15763},
year = {2022}
}