对大型视觉语言模型在智能交通系统中的恶性攻击
人工智能
2025-11-19 v1
摘要
大型视觉语言模型(Large Vision Language Models, LVLMs)在多模态推理和众多实际应用中展现出强大的能力,例如视觉问答。然而,LVLMs 对恶性攻击极其脆弱。本文系统地分析了在恶意查询下集成到智能交通系统(Intelligent Transportation Systems, ITS)中的 LVLMs 的漏洞。首先,我们遵循 OpenAI 的禁用类别构建包含与交通相关的有害查询的数据集,以防止 LVLMs 对此类查询作出响应。其次,我们引入一种新型的恶性攻击,通过图像排版操作和多轮提问利用 LVLMs 的漏洞。再次,我们提出一种多层次的响应过滤防御技术,以防止模型生成不当响应。我们在最先进的 LVLMs(包括开源和闭源模型)上进行大量实验,以评估所提出的攻击方法和防御技术。为评估攻击方法和防御技术,我们使用 GPT-4 的判断来确定生成响应的毒性分数,并进行人工验证。进一步,我们将所提出的恶性攻击方法与现有恶性攻击技术进行比较,并强调在图像排版操作和多轮提问方面,对集成到 ITS 的 LVLMs 所涉及的严重安全风险。
引用
@article{arxiv.2511.13892,
title = {Jailbreaking Large Vision Language Models in Intelligent Transportation Systems},
author = {Badhan Chandra Das and Md Tasnim Jawad and Md Jueal Mia and M. Hadi Amini and Yanzhao Wu},
journal= {arXiv preprint arXiv:2511.13892},
year = {2025}
}