中文

基于数据流形一致性感知的对抗性净化

机器学习 2024-12-12 v1

摘要

深度神经网络(DNNs)对由向干净数据添加不可察觉扰动而制作的对抗样本极其脆弱,这可能导致不正确且危险的预测。对抗性净化是一种有效提升 DNNs 鲁棒性的方法,通过在将数据输入模型前去除这些扰动。然而,这面临着在保持数据关键结构和语义信息方面的重大挑战,因为不可察觉的对抗扰动使得避免过度纠正变得困难,过度纠正会破坏重要信息并降低模型性能。本文摆脱了传统对抗性净化方法的束缚,专注于干净数据所在的流形上。为此,我们揭示了经过良好训练的生成模型生成的样本与干净样本接近,但与对抗样本相距甚远。基于此洞见,我们提出了基于一致性模型的数据流形优化的对抗性净化方法(CMAP),通过优化预训练一致性模型的潜在空间中的向量来生成用于恢复干净数据的样本。具体而言:(1)我们提出了感知一致性恢复机制,通过最小化生成样本与输入样本在像素和感知空间之间的差异;(2)为保持优化后的潜在向量位于有效数据流形内,我们引入了潜在分布一致性约束策略,以将生成样本与干净数据分布对齐;(3)我们还通过集成方法应用潜在向量一致性预测方案以增强预测可靠性。CMAP 从根本上解决了对抗扰动的来源,提供了稳健的净化。大量实验表明,在 CIFAR-10 和 ImageNet-100 上的实验显示,我们的 CMAP 在抵御强大对抗攻击方面显著提升了鲁棒性,同时保持了高水平的自然准确率。

关键词

引用

@article{arxiv.2412.08394,
  title  = {Adversarial Purification by Consistency-aware Latent Space Optimization on Data Manifolds},
  author = {Shuhai Zhang and Jiahao Yang and Hui Luo and Jie Chen and Li Wang and Feng Liu and Bo Han and Mingkui Tan},
  journal= {arXiv preprint arXiv:2412.08394},
  year   = {2024}
}

备注

17 pages, 8 figures