中文

利用增强可解释性的架构解释对抗攻击与防御

机器学习 2025-02-24 v1 密码学与安全

摘要

深度学习中的对抗攻击对机器学习模型的完整性和可靠性构成重大威胁。对抗训练一直是抵御这些对抗攻击的流行防御技术。在这项工作中,我们利用一种网络架构,即深度线性门控网络(DLGN),它比常规深度网络架构具有更好的解释能力。利用该架构,我们解释使用 PGD 对抗训练训练的鲁棒模型,并将其与标准训练进行比较。DLGN 中的特征网络充当特征提取器,使其成为对手攻击模型的唯一媒介。我们分析了具有全连接层的 DLGN 的特征网络,涉及超平面对齐、超平面与 PCA 的关系以及类间子网络重叠等属性,并比较了鲁棒模型和标准模型之间的这些属性。我们还考虑了具有 CNN 层的该架构,其中我们定性地(使用可视化)和定量地对比了鲁棒模型和标准模型之间的门控模式。我们揭示了 PGD-AT 和 STD-TR 模型中超平面类似于主成分的见解,其中 PGD-AT 超平面与数据点的对齐距离更远。我们使用路径活动分析表明,PGD-AT 模型在不同类之间创建了多样化、非重叠的活跃子网络,从而防止了攻击引起的门控重叠。我们的可视化思路展示了 PGD-AT 和 STD-TR 模型所学表示的性质。

关键词

引用

@article{arxiv.2502.15017,
  title  = {Interpreting Adversarial Attacks and Defences using Architectures with Enhanced Interpretability},
  author = {Akshay G Rao and Chandrashekhar Lakshminarayanan and Arun Rajkumar},
  journal= {arXiv preprint arXiv:2502.15017},
  year   = {2025}
}

备注

Publication accepted at AAAI Deployable AI conference 2025 (proof - https://sites.google.com/view/dai-2025/accepted-papers?authuser=0) Total 17 pages