攻击基础模型的注意力机制破坏下游任务
密码学与安全
2025-09-15 v3 机器学习
摘要
基础模型代表着人工智能领域最突出且最新的范式转变。基础模型是大规模模型,训练数据广泛,能在许多下游任务中实现高准确率,往往无需微调。因此,诸如 CLIP、DINO 或 Vision Transformer(ViT)等模型正成为许多工业级 AI 应用的基石。然而,对预训练基础模型的依赖也引入了显著的安全风险,这些模型对对抗攻击极其脆弱。此类攻击涉及精心设计的输入,以欺骗 AI 系统,危及其可靠性。本文聚焦于视觉基础模型的脆弱性,特别是 CLIP 和 ViT,探讨对抗攻击向下游任务的可传递性。我们引入一种新型攻击,针对基于 Transformer 架构的结构设计,具有任务无关性。我们展示了该攻击在多个下游任务上的有效性:分类、描述、图像/文本检索、分割和深度估计。代码地址:https://github.com/HondamunigePrasannaSilva/attack-attention
引用
@article{arxiv.2506.05394,
title = {Attacking Attention of Foundation Models Disrupts Downstream Tasks},
author = {Hondamunige Prasanna Silva and Federico Becattini and Lorenzo Seidenari},
journal= {arXiv preprint arXiv:2506.05394},
year = {2025}
}
备注
Paper published at CVPR 2025 Workshop Advml