对基础视觉模型的对抗攻击
计算机视觉与模式识别
2023-08-29 v1 密码学与安全
机器学习
摘要
在开发大型、预训练、任务无关的基础视觉模型(如CLIP、ALIGN、DINOv2等)方面正取得快速进展。事实上,我们正接近这样的阶段:这些模型无需在下游微调,即可在零样本下或通过轻量级探测头直接使用。关键的是,鉴于在此规模下工作的复杂性,存在一个瓶颈,即世界上相对少的组织在执行训练后于集中式平台(如HuggingFace和torch.hub)上共享模型。本工作的目标是识别这些模型的若干关键对抗脆弱性,以促使未来设计更具鲁棒性。直观上,我们的攻击操纵深度特征表示以欺骗分布外(OOD)检测器,而当使用这些开放世界感知模型解决闭集下游任务时,该检测器是必需的。我们的方法在极低知识假设威胁模型下,可靠地使分布内(ID)图像(相对于下游任务)被预测为OOD,反之亦然。我们展示了我们的攻击在白盒与黑盒设定下均有效,且在基础模型类型间迁移时亦如此(例如,用CLIP攻击DINOv2)!本工作仅是迈向对抗鲁棒基础视觉模型漫长旅程的开端。
引用
@article{arxiv.2308.14597,
title = {Adversarial Attacks on Foundational Vision Models},
author = {Nathan Inkawhich and Gwendolyn McDonald and Ryan Luley},
journal= {arXiv preprint arXiv:2308.14597},
year = {2023}
}