运用保形预测增强对抗鲁棒性:面向保证模型可靠性的框架
机器学习
2025-06-10 v1 人工智能
机器学习
摘要
随着深度学习模型在高风险应用中不断部署,对抗攻击的鲁棒性和可靠的性能保证日益至关重要。此外,准确率本身并不足以提供足够的保证或可靠的不确定性估计。本研究通过利用保形预测的原则来推进对抗训练。具体而言,我们开发了一种对抗攻击方法,称为 OPSA(OPtimal Size Attack),旨在通过最大化模型不确定性而无需覆盖保证来降低保形预测的效率。相应地,我们引入 OPSA-AT(对抗训练),这是一种新的保形训练范式,将 OPSA 集成其中。实验评估表明,我们的 OPSA 攻击方法在 various defenses 中诱导的不确定性显著高于基线方法。相反,我们的 OPSA-AT 防御模型不仅对 OPSA 以及其他对抗攻击显著增强了鲁棒性,还保持了可靠的预测。我们的发现突显了这一集成方法在开发用于安全关键领域的可信赖和有韧性的深度学习模型方面的有效性。我们的代码已在 https://github.com/bjbbbb/Enhancing-Adversarial-Robustness-with-Conformal-Prediction 上提供。
引用
@article{arxiv.2506.07804,
title = {Enhancing Adversarial Robustness with Conformal Prediction: A Framework for Guaranteed Model Reliability},
author = {Jie Bao and Chuangyin Dang and Rui Luo and Hanwei Zhang and Zhixin Zhou},
journal= {arXiv preprint arXiv:2506.07804},
year = {2025}
}