权空间分类器中的对抗攻击
机器学习
2026-03-04 v3
摘要
隐式神经表征(INR)近期因其能够以紧凑、连续的方式表示大型复杂数据而在各个研究领域中受到日益关注。此前的工作进一步表明,许多主流下游任务可直接在 INR 参数空间中执行。这样做可以大幅降低处理其原始域中表示数据的计算资源需求。现代机器学习方法的一个主要难点是其高度易受对抗攻击影响,这些攻击已被证明在广泛范围的应用场景中严重限制了该方法的可靠性和适用性。在本 work 中,我们对权空间分类器在对抗攻击下的行为进行深入的安全分析。我们的研究表明,针对分类任务训练的参数空间模型对标准白盒对抗攻击的鲁棒性优于 operate in 原始信号空间的标准分类器。这一成果无需任何鲁棒训练即可实现。我们将这种鲁棒性归因于 INR 优化过程中产生的梯度混淆现象,并指出该鲁棒性在 alternative 对抗方法下的局限性。为支持我们的论点,我们开发了一套针对参数空间分类器的新型对抗攻击工具箱,并进一步分析了此类攻击的实际考虑因素。
引用
@article{arxiv.2502.20314,
title = {Adversarial Attacks in Weight-Space Classifiers},
author = {Tamir Shor and Ethan Fetaya and Chaim Baskin and Alex Bronstein},
journal= {arXiv preprint arXiv:2502.20314},
year = {2026}
}