中文

对基础视觉模型的对抗攻击

计算机视觉与模式识别 2023-08-29 v1 密码学与安全 机器学习

摘要

在开发大型、预训练、任务无关的基础视觉模型(如CLIP、ALIGN、DINOv2等)方面正取得快速进展。事实上,我们正接近这样的阶段:这些模型无需在下游微调,即可在零样本下或通过轻量级探测头直接使用。关键的是,鉴于在此规模下工作的复杂性,存在一个瓶颈,即世界上相对少的组织在执行训练后于集中式平台(如HuggingFace和torch.hub)上共享模型。本工作的目标是识别这些模型的若干关键对抗脆弱性,以促使未来设计更具鲁棒性。直观上,我们的攻击操纵深度特征表示以欺骗分布外(OOD)检测器,而当使用这些开放世界感知模型解决闭集下游任务时,该检测器是必需的。我们的方法在极低知识假设威胁模型下,可靠地使分布内(ID)图像(相对于下游任务)被预测为OOD,反之亦然。我们展示了我们的攻击在白盒与黑盒设定下均有效,且在基础模型类型间迁移时亦如此(例如,用CLIP攻击DINOv2)!本工作仅是迈向对抗鲁棒基础视觉模型漫长旅程的开端。

关键词

引用

@article{arxiv.2308.14597,
  title  = {Adversarial Attacks on Foundational Vision Models},
  author = {Nathan Inkawhich and Gwendolyn McDonald and Ryan Luley},
  journal= {arXiv preprint arXiv:2308.14597},
  year   = {2023}
}