零牺牲持久鲁棒性对抗防御:面向预训练编码器
机器学习
2026-02-13 v1 人工智能
摘要
自监督学习(SSL)中公开可用的预训练编码器的广泛使用暴露了一个关键漏洞:它们易受下游无关对抗样本(DAE)的攻击,这些样本是在不了解下游任务的情况下生成的,但能够误导下游模型。尽管最近探索了几种防御方法,但它们主要依赖于特定任务的对抗性微调,这不可避免地限制了泛化能力,并导致灾难性遗忘和良性性能下降。与先前工作不同,我们提出了一个更严格的防御目标,该目标仅需针对多样化的下游任务进行一次微调,即可防御DAE并保持良性性能。为实现这一防御目标,我们引入了零牺牲持久鲁棒性对抗防御(ZePAD),其灵感来源于神经网络对数据特征的固有敏感性。具体来说,ZePAD是一种双分支结构,包含一个多模式对抗增强分支(MPAE-Branch),该分支使用两个经过对抗性微调的编码器来增强对抗鲁棒性。良性记忆保持分支(BMP-Branch)在本地数据上进行训练,以确保对抗鲁棒性不会损害良性性能。令人惊讶的是,我们发现ZePAD可以直接通过评估分支置信度来检测DAE,而无需在训练过程中引入任何对抗样本识别任务。值得注意的是,通过丰富特征多样性,我们的方法使得单次对抗性微调能够跨下游任务防御DAE,从而实现持久鲁棒性。在11种SSL方法和6个数据集上的大量实验验证了其有效性。在某些情况下,良性性能提升了29.20%,对抗鲁棒性提升了73.86%,突显了其零牺牲特性。
引用
@article{arxiv.2602.11204,
title = {Zero-Sacrifice Persistent-Robustness Adversarial Defense for Pre-Trained Encoders},
author = {Zhuxin Lei and Ziyuan Yang and Yi Zhang},
journal= {arXiv preprint arXiv:2602.11204},
year = {2026}
}