中文

因果可解释性与对抗鲁棒性:一种混合生成分类方法

计算机视觉与模式识别 2025-12-09 v2

摘要

深度学习基于判别的分类器尽管取得了显著的成功,却仍然对能够误导模型预测的对抗样本保持脆弱。虽然对抗训练可以增强鲁棒性,但无法解决源于这些黑盒模型不透明性所致的内在脆弱性。我们提出了一个深度集成模型,将判别特征与生成模型结合,以实现高精度和对抗鲁棒性。该方法集成了一个底层预训练的判别网络用于特征提取,以及一个顶层生成分类网络,通过深度潜在变量模型来建模对抗输入分布。利用变分贝叶斯方法,我们的模型在无需对抗训练的情况下对白箱对抗攻击表现出优异的鲁棒性。在 CIFAR-10 和 CIFAR-100 上的大量实验表明,我们的模型在对抗鲁棒性方面具有优势。通过使用反事实指标和特征交互基于的指标进行评估,我们建立了模型可解释性与对抗鲁棒性之间的相关性。此外,针对 Tiny-ImageNet 的初步结果验证了该方法对更复杂数据集的可扩展性,为开发稳健的图像分类模型提供了实用解决方案。

关键词

引用

@article{arxiv.2412.20025,
  title  = {Causal Interpretability for Adversarial Robustness: A Hybrid Generative Classification Approach},
  author = {Chunheng Zhao and Pierluigi Pisu and Gurcan Comert and Negash Begashaw and Varghese Vaidyan and Nina Christine Hubig},
  journal= {arXiv preprint arXiv:2412.20025},
  year   = {2025}
}