具有可泛化鲁棒性的认证因果防御
机器学习
2026-05-29 v3 密码学与安全
统计方法学
摘要
尽管机器学习模型在各种场景中已被证明是有效的,但人们普遍认为许多模型容易受到对抗性攻击。最近,出现了许多对抗性防御的努力。其中,认证防御以其在输入的一定范围内(例如,球)对任意对抗性扰动的理论保证而闻名。然而,该领域的大多数现有工作难以将其认证鲁棒性泛化到具有分布偏移的其他数据域。这个问题源于难以消除虚假相关性对不同域中鲁棒性的负面影响。为了解决这个问题,在这项工作中,我们提出了一种新颖的认证防御框架GLEAN,它将因果视角引入到认证防御的泛化问题中。更具体地说,我们的框架集成了一个可认证的因果因子学习组件,以解开输入和标签之间的因果关系和虚假相关性,从而排除虚假相关性对防御的负面影响。在此基础上,我们设计了一种因果认证防御策略来处理对潜在因果因子的对抗性攻击。通过这种方式,我们的框架不仅对训练分布中数据上的恶意噪声具有鲁棒性,而且还可以将其鲁棒性泛化到具有分布偏移的各个域。在基准数据集上的大量实验验证了我们的框架在不同数据域中认证鲁棒性泛化的优越性。代码可在补充材料中找到。
引用
@article{arxiv.2408.15451,
title = {Certified Causal Defense with Generalizable Robustness},
author = {Yiran Qiao and Yu Yin and Chen Chen and Jing Ma},
journal= {arXiv preprint arXiv:2408.15451},
year = {2026}
}
备注
Accepted by AAAI 2025