中文

目标导向的下游无关攻击

计算机视觉与模式识别 2026-05-20 v1 人工智能

摘要

近年来,预训练编码器因其在表示提取方面的强大能力而得到广泛应用。然而,它们容易受到下游无关攻击(DAA)的影响。现有的DAA方法在一种宽松的威胁模型下运行,其中如果生成的下游无关对抗样本(DAE)改变了原始预测,则攻击成功,而不需要特定的目标。在本文中,我们提出了一种目标导向的DAA(TDAA)方法,该方法采用更严格的威胁模型,要求攻击既是目标导向的又是下游无关的。由于下游任务未知且编码器不直接产生预测,实现目标导向攻击尤其具有挑战性。为了解决这个问题,我们引入了一个新颖的组件,称为“威胁图像”,由攻击者预先选择作为目标。具体来说,设计了一个生成器来产生特定于样本的对抗性扰动,迫使受害编码器为DAE和威胁图像输出相同的特征。与之前为所有样本生成单个共享扰动的DAA方法(由于图像多样性而经常失败)不同,我们的方法采用了一种特定于样本的范式。这为每个图像生成量身定制的扰动,以确保高攻击成功率和不可见性。通过利用威胁图像作为特征级锚点,我们的方法建立了一个任务无关的桥梁来揭示受害编码器的脆弱性。在3个基准数据集上的10种自监督方法上进行的大量实验证明了我们方法的有效性,并揭示了预训练编码器的显著脆弱性。代码将在评审期后公开。

关键词

引用

@article{arxiv.2605.19446,
  title  = {Targeted Downstream-Agnostic Attack},
  author = {Zhuxin Lei and Ziyuan Yang and Yi Zhang},
  journal= {arXiv preprint arXiv:2605.19446},
  year   = {2026}
}