提升多模态预训练模型定向对抗攻击的泛化性与不可检测性
计算机视觉与模式识别
2025-09-30 v2
摘要
多模态预训练模型(如ImageBind)将不同数据模态对齐到共享嵌入空间,在下游任务中取得了显著成功。然而,其日益广泛的应用引发了严重的安全关切,尤其是关于定向对抗攻击的问题。本文表明,现有的多模态预训练模型定向对抗攻击在两个维度上仍存在局限性:泛化性和不可检测性。具体而言,构造的定向对抗样本在跨模态对齐任务中对部分已知或语义相似的目标表现出有限的泛化能力(即泛化性有限),并且容易被简单的异常检测方法检测到(即不可检测性有限)。为解决这些局限性,本文提出了一种名为代理定向攻击(Proxy Targeted Attack, PTA)的新方法,该方法利用多个源模态和目标模态代理来优化定向对抗样本,确保其在规避防御的同时与多个潜在目标对齐。我们还提供了理论分析,以揭示泛化性与不可检测性之间的关系,并确保在满足不可检测性指定要求的同时实现最优泛化性。此外,实验结果表明,我们的PTA能够在各种相关目标上取得高成功率,并且在多种异常检测方法下保持不可检测性。
引用
@article{arxiv.2509.19994,
title = {Improving Generalizability and Undetectability for Targeted Adversarial Attacks on Multimodal Pre-trained Models},
author = {Zhifang Zhang and Jiahan Zhang and Shengjie Zhou and Qi Wei and Shuo He and Feng Liu and Lei Feng},
journal= {arXiv preprint arXiv:2509.19994},
year = {2025}
}