面向通用扰动的跨输入认证训练
机器学习
2024-09-10 v2 密码学与安全
摘要
可信机器学习领域的现有工作主要关注单输入对抗扰动。在许多真实世界攻击场景中,输入无关的对抗攻击,例如通用对抗扰动 (UAP),更为可行。当前的认证训练方法在单输入扰动上具有鲁棒性,但在标准准确率和 UAP 准确率方面表现次佳,从而限制了其在实际应用中的适用性。我们提出一种新方法 CITRUS,用于对抗 UAP 攻击的认证训练。我们在不同数据集、不同架构和不同扰动幅度下的广泛评估表明,我们的方法在标准准确率上优于传统认证训练方法(提高最高达 10.3%),并在更实用的认证 UAP 准确率指标上实现 SOTA 水平。
引用
@article{arxiv.2405.09176,
title = {Cross-Input Certified Training for Universal Perturbations},
author = {Changming Xu and Gagandeep Singh},
journal= {arXiv preprint arXiv:2405.09176},
year = {2024}
}
备注
23 pages, 6 figures, ECCV '24