中文

良性过拟合对对抗鲁棒性的惊人危害

机器学习 2024-01-26 v2 密码学与安全 机器学习

摘要

近期的实证和理论研究已经确立了大型机器学习模型在(近似或精确)拟合噪声数据时的泛化能力。在这项工作中,我们证明了一个令人惊讶的结果:即使真实目标函数本身对对抗样本是鲁棒的,并且良性过拟合模型在“标准”样本外风险目标方面是良性的,但当样本外数据受到对抗性操纵时,这种良性过拟合过程可能是有害的。更具体地说,我们的主要结果包含两部分:(i) 在“良性过拟合”设定下,过参数化线性模型中的最小范数估计量总是导致对抗脆弱性;(ii) 我们验证了每个岭回归估计量的标准风险与“对抗”风险之间的渐近权衡结果,这意味着在合适的条件下,通过任何单一的岭正则化参数选择,这两者不可能同时很小。此外,在惰性训练机制下,我们在两层神经正切核(NTK)模型上证明了平行的结果,这与深度神经网络中的实证观察结果一致。我们的发现为实践中观察到的令人费解的现象提供了理论见解,即真实目标函数(例如,人类)对对抗攻击是鲁棒的,而良性过拟合的神经网络却导致模型不鲁棒。

关键词

引用

@article{arxiv.2401.12236,
  title  = {The Surprising Harmfulness of Benign Overfitting for Adversarial Robustness},
  author = {Yifan Hao and Tong Zhang},
  journal= {arXiv preprint arXiv:2401.12236},
  year   = {2024}
}