ImgTrojan:单图像劫持视觉语言模型
计算机视觉与模式识别
2025-09-30 v3 人工智能
摘要
近年来,越来越多关注大语言模型(LLM)与人类价值观的对齐,但其与视觉模块集成后的视觉语言模型(VLM)安全问题相对缺乏探讨。本文提出一种新颖的对VLM进行劫持攻击的方法,旨在绕过其安全屏障。我们假设被投毒的(图像,文本)数据对被包含在训练数据中。通过替换原始文本描述为恶意劫持提示,我们的方法可对投毒图像执行劫持攻击。此外,我们分析了投毒比例和可训练参数位置对攻击成功率的影响。为评估,我们设计了两个指标量化攻击成功率与隐蔽性。我们提供了一套精选的有害指令,构建了衡量攻击效果的基准。通过与基线方法的比较,我们展示了该攻击的有效性。
引用
@article{arxiv.2403.02910,
title = {ImgTrojan: Jailbreaking Vision-Language Models with ONE Image},
author = {Xijia Tao and Shuai Zhong and Lei Li and Qi Liu and Lingpeng Kong},
journal= {arXiv preprint arXiv:2403.02910},
year = {2025}
}