中文

延迟投毒:通过 Hessian 奇异性化使模型更脆弱

机器学习 2025-12-12 v3 密码学与安全 计算机视觉与模式识别

摘要

近期研究表明深度学习模型对投毒攻击非常脆弱。已提出许多防御方法来应对这一问题。然而,传统投毒攻击并没有通常认为的那样具有威胁性。这是因为它们往往导致模型在训练集上的表现与在验证集上的表现不一致。这种不一致性会提醒防御者其数据已被投毒,从而使他们能够采取必要的防御措施。在本文中,我们引入了一种更具威胁性的投毒攻击类型,称为延迟投毒攻击。这种新攻击使模型在训练和验证阶段能够正常运行,但使其对逃避攻击甚至自然噪声非常敏感。我们通过确保投毒模型在每个输入样本上的损失函数值与正常训练模型相似但具有较大的局部曲率来实现这一点。相似的模型损失意味着训练准确率与验证准确率之间没有明显不一致,表现出高隐蔽性。另一方面,较大的曲率意味着微小扰动可能导致模型损失显著增加,从而导致严重的性能退化,这反映了更差的鲁棒性。我们通过所提出的奇异性正则化项使模型在最优点处具有奇异的 Hessian 信息来实现这一目的。我们对所提方法进行了理论和实证分析,并通过图像分类任务的实验验证了其有效性。此外,我们在更一般的场景下通过自然噪声确认了这种投毒攻击的危害,为该安全领域的研究提供了新视角。

关键词

引用

@article{arxiv.2411.03752,
  title  = {Deferred Poisoning: Making the Model More Vulnerable via Hessian Singularization},
  author = {Yuhao He and Jinyu Tian and Xianwei Zheng and Li Dong and Yuanman Li and Jiantao Zhou},
  journal= {arXiv preprint arXiv:2411.03752},
  year   = {2025}
}