中文

NeuroShield:面向对抗鲁棒性的神经符号框架

机器学习 2026-01-21 v1 新兴技术

摘要

对抗脆弱性与缺乏可解释性是深度神经网络的关键局限,尤其在自动驾驶等安全敏感场景中。我们提出了 \DesignII,一种将符号规则监督集成到神经网络中的神经符号框架,以同时增强对抗鲁棒性与可解释性。领域知识被编码为关于形状和颜色等外观属性的逻辑约束,并在训练期间通过语义与符号逻辑损失加以强制执行。我们使用 GTSRB 数据集,在标准 \ell_\infty 扰动预算 ε=8/255\varepsilon = 8/255 下评估了针对 FGSM 和 PGD 攻击的鲁棒性。相较于干净训练,标准对抗训练在鲁棒性上提供了适度的提升(约 10 个百分点)。相反,我们的 FGSM-Neuro-Symbolic 和 PGD-Neuro-Symbolic 模型获得了显著更大的提升,在相应的对抗训练基线之上分别将对抗精度提高了 18.1% 和 17.35%;当两者均相对于相同的干净训练基线进行测量时,这表示其鲁棒性增益约为标准对抗训练的三倍,且未降低干净样本精度。与 LNL-MoEx 等基于 Transformer 的防御方法相比(后者需要沉重的架构和大量的数据增强),我们的 PGD-Neuro-Symbolic 变体使用训练 10 个 epoch 的 ResNet18 主干网络便获得了可比拟或更优的鲁棒性。这些结果表明,符号推理为鲁棒且可解释的 AI 提供了一条有效路径。

关键词

引用

@article{arxiv.2601.13162,
  title  = {NeuroShield: A Neuro-Symbolic Framework for Adversarial Robustness},
  author = {Ali Shafiee Sarvestani and Jason Schmidt and Arman Roohi},
  journal= {arXiv preprint arXiv:2601.13162},
  year   = {2026}
}