中文

通过触发器激活实现对可迁移对抗样本的鲁棒模型

密码学与安全 2025-04-22 v1 计算机视觉与模式识别 机器学习

摘要

对抗样本以不可察觉的扰动为特征,对深度神经网络构成重大威胁,通过误导其预测。这些样本的一个关键特性是其可迁移性,使其在黑盒场景中能欺骗未见的模型。尽管已广泛探索防御方法,包括针对可迁移性的防御,但仍表现出效率低下、防御无效以及对干净图像性能下降等局限。本工作提出一种新的训练范式,旨在以更高效和更有效的方式增强对可迁移对抗样本(TAEs)的鲁棒性。我们提出一种模型,当输入干净数据 x\boldsymbol{x} 时表现出随机猜测行为,而在输入带触发器数据 x+τ\boldsymbol{x}+\boldsymbol{\tau} 时生成准确预测。值得注意的是,触发器 τ\boldsymbol{\tau} 对所有数据实例保持不变。我们将此类模型称为具备触发器激活的模型。我们惊讶地发现,这些模型对TAEs表现出一定鲁棒性。通过考虑一阶梯度,我们对这种鲁棒性进行了理论分析。此外,通过对可学习触发器与模型的联合优化,我们实现了对可迁移攻击的改进鲁棒性。跨越多个数据集、评估多种攻击方法的大量实验均凸显了该方法的有效性与优越性。

关键词

引用

@article{arxiv.2504.14541,
  title  = {Towards Model Resistant to Transferable Adversarial Examples via Trigger Activation},
  author = {Yi Yu and Song Xia and Xun Lin and Chenqi Kong and Wenhan Yang and Shijian Lu and Yap-Peng Tan and Alex C. Kot},
  journal= {arXiv preprint arXiv:2504.14541},
  year   = {2025}
}

备注

Accepted by IEEE TIFS 2025