解释性导向的防御:针对对抗数据攻击的归因感知模型精炼
机器学习
2026-01-06 v1
摘要
深度学习模型在医疗和自动导航等安全关键领域的日益增长的依赖,凸显了对既能抵御对抗扰动又在决策-making 中透明可靠的防御机制的迫切需求。本文识别了可在训练中直接利用的解释性与鲁棒性之间的关联。具体而言,我们观察到通过局部可解释模型无关解释 (LIME) 识别出的伪影、不稳定或语义无关特征,对对抗脆弱性贡献显著。基于这一洞见,我们引入一种归因感知的精炼框架,将 LIME 从被动诊断工具转化为主动训练信号。该方法通过特征遮蔽、灵敏度感知正则化和对抗数据增强在闭环精炼管道中系统性抑制伪影特征。该方法无需额外数据集或模型架构,即可无缝集成到标准对抗训练中。理论上,我们推导出归因感知的对抗扰动下界,形式化阐释了解释对齐与鲁棒性之间的联系。在 CIFAR-10、CIFAR-10-C 和 CIFAR-100 上的实验评估表明,该方法在对抗鲁棒性和跨域外推方面均实现了显著提升。
引用
@article{arxiv.2601.00968,
title = {Explainability-Guided Defense: Attribution-Aware Model Refinement Against Adversarial Data Attacks},
author = {Longwei Wang and Mohammad Navid Nayyem and Abdullah Al Rakin and KC Santosh and Chaowei Zhang and Yang Zhou},
journal= {arXiv preprint arXiv:2601.00968},
year = {2026}
}
备注
8pages,4 figures