极端校准失准与对抗鲁棒性的幻觉
计算与语言
2024-10-15 v3
摘要
基于深度学习的自然语言处理 (NLP) 模型易受对抗攻击,微小的扰动即可导致模型误分类。对抗训练 (AT) 常用于提高模型的鲁棒性。然而,我们发现了一个有趣的现象:故意或意外地使模型校准失准会以一种干扰对抗攻击搜索方法的方式掩盖梯度,从而产生表观上的鲁棒性增加。我们表明,这种观察到的鲁棒性增益是一种鲁棒性幻觉 (IOR),并展示了对手如何执行各种形式的测试时温度校准来消除上述干扰,从而使对抗攻击能够找到对抗样本。因此,我们敦促 NLP 社区将测试时温度缩放纳入其鲁棒性评估中,以确保任何观察到的增益都是真实的。最后,我们展示了如何在\textit{训练}期间缩放温度以提高真实的鲁棒性。
引用
@article{arxiv.2402.17509,
title = {Extreme Miscalibration and the Illusion of Adversarial Robustness},
author = {Vyas Raina and Samson Tan and Volkan Cevher and Aditya Rawal and Sheng Zha and George Karypis},
journal= {arXiv preprint arXiv:2402.17509},
year = {2024}
}