开放基础模型中视觉对抗鲁棒性
计算机视觉与模式识别
2025-12-22 v1 人工智能
密码学与安全
摘要
随着深度学习的不断发展,越来越难以理解能够识别物体的 AI 系统。因此,敌对者可能会试图通过添加不可见元素来修改图像,从而混淆 AI 在识别实体方面的能力。因此,本文调查了 LLaVA-1.5-13B 和 Meta 的 Llama 3.2 Vision-8B-2 的对抗鲁棒性。这些模型针对视觉输入模态进行了针对性的 PGD(投影梯度下降)攻击,并在 Visual Question Answering (VQA) v2 数据集子集上进行了经验评估。随后使用标准 VQA 准确度指标对这些对抗攻击结果进行量化。我们将这些结果与 LLaVA 和 Llama 3.2 Vision 的准确度下降(准确度下降)进行比较。关键发现是,尽管 Llama 3.2 Vision 在此设置下基准准确度较低,但在攻击下的性能下降幅度更小,尤其是在更高的扰动水平下。总体而言,发现结果确认视觉模态代表了一种可行的攻击向量,可降低当代开源视觉-语言模型(VLMs)的性能,包括 Meta 的 Llama 3.2 Vision。此外,这些发现表明,对抗鲁棒性并不必然与标准基准性能直接相关,可能受到底层架构和训练因素的影响。
引用
@article{arxiv.2512.17902,
title = {Adversarial Robustness of Vision in Open Foundation Models},
author = {Jonathon Fox and William J Buchanan and Pavlos Papadopoulos},
journal= {arXiv preprint arXiv:2512.17902},
year = {2025}
}