中文

大型视觉语言模型攻击综述:资源、进展与未来趋势

计算机视觉与模式识别 2024-07-15 v2

摘要

近年来,随着大模型的快速发展,大型视觉语言模型 (LVLMs) 在广泛的多模态理解与推理任务中展现出卓越的能力。与传统的大型语言模型 (LLMs) 相比,LVLMs 因其更贴近多资源真实世界应用场景以及多模态处理的复杂性,具备巨大的潜力与挑战。然而,LVLMs 的脆弱性相对探索不足,可能在日常使用中引发潜在的安全风险。本文提供了全面回顾现有 LVLMs 攻击的各种形式。具体而言,我们首先介绍针对 LVLMs 的攻击背景,包括攻击概述、攻击挑战及攻击资源。随后,我们系统回顾了 LVLMs 攻击方法的发展,如操控模型输出的对抗攻击、利用模型脆弱性执行未授权操作的越狱攻击、工程化提示类型与模式的提示注入攻击以及影响模型训练的数据投毒攻击。最后,我们讨论了未来可期的研究方向。我们相信,本综述为 LVLMs 当前脆弱性格局提供了洞见,激励更多研究者探索并缓解 LVLMs 开发中潜在的安全问题。最新的关于 LVLMs 攻击的论文将持续收集于 https://github.com/liudaizong/Awesome-LVLM-Attack。

关键词

引用

@article{arxiv.2407.07403,
  title  = {A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends},
  author = {Daizong Liu and Mingyu Yang and Xiaoye Qu and Pan Zhou and Yu Cheng and Wei Hu},
  journal= {arXiv preprint arXiv:2407.07403},
  year   = {2024}
}