中文

通过t-SNE视角探索图层级对抗鲁棒性

机器学习 2024-06-21 v1 人工智能 神经与进化计算

摘要

对抗性样本是旨在欺骗人工神经网络(ANN)产生错误输出的输入,凸显了这些模型的漏洞。探索这些弱点对于开发防御措施至关重要,因此,我们提出了一种评估图像分类ANN对抗鲁棒性的方法。t分布随机邻居嵌入(t-SNE)技术用于视觉检查,一种比较干净和扰动嵌入的度量有助于定位各层的薄弱环节。分析两个在CIFAR-10上的ANN,一个由人类设计,另一个通过神经进化获得,我们发现干净和扰动表征之间的差异在特征提取层中早期出现,影响后续分类。我们度量的结果得到t-SNE图视觉分析的支持。

关键词

引用

@article{arxiv.2406.14073,
  title  = {Exploring Layerwise Adversarial Robustness Through the Lens of t-SNE},
  author = {Inês Valentim and Nuno Antunes and Nuno Lourenço},
  journal= {arXiv preprint arXiv:2406.14073},
  year   = {2024}
}