当数据操控遇上攻击目标:面向视觉语言模型的攻击策略全景调查
计算机视觉与模式识别
2025-02-12 v2
摘要
视觉语言模型(Vision-Language Models, VLMs)因其在整合和处理文本与视觉信息方面的卓越能力,在近年来广受关注。这一集成显著提升了在场景感知和机器人等众多应用领域的性能。然而,VLMs的部署也引发了严峻的安全与安全隐患,亟需广泛研究评估这些系统潜在的脆弱性。本文present了针对VLMs的攻击策略全景调查。我们根据攻击目标对这些攻击进行分类——即越狱、伪装和利用,同时详细阐述了用于VLMs数据操控的各种方法。我们还概述了针对这些脆弱性所提出的相应防御机制。通过洞察不同攻击类型的关键联系与差异,我们提出了一套引人注目的VLMs攻击分类框架。此外,我们总结了描述VLMs不同攻击特征与影响的评估指标。最后,我们结论性地讨论了旨在进一步提升VLMs鲁健性与安全性的有前景的未来研究方向,强调在这一关键研究领域持续探索的重要性。为促进社区参与,我们维护了一个最新项目页面,地址为:https://github.com/AobtDai/VLM_Attack_Paper_List。
引用
@article{arxiv.2502.06390,
title = {When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs},
author = {Aobotao Dai and Xinyu Ma and Lei Chen and Songze Li and Lin Wang},
journal= {arXiv preprint arXiv:2502.06390},
year = {2025}
}