Playing Devil's Advocate: unmasking 视觉语言模型中的有害行为与漏洞
密码学与安全
2025-01-17 v1 人工智能
计算机与社会
摘要
大型视觉语言模型(LVLMs)的快速发展提升了其能力,展现出从内容创作到生产力提升的潜在应用。尽管具有创新潜力,但 LVLMs 在生成潜在有害或不安全响应方面存在漏洞。恶意行为者可以利用这些漏洞,通过不调参或不进行计算密集型操作的方式,通过战术性精心设计的提示来自动化(或半自动化)传播有害内容。尽管已有红队测试和固有的潜在风险被充分考虑,但 LVLMs 的漏洞研究仍处于初级阶段,尚未得到系统性地解决。本研究系统性地检查了开源 LVLMs(包括 LLaVA、InstructBLIP、Fuyu 和 Qwen)的漏洞,采用模拟现实世界社交操纵策略的对抗性提示策略,这些策略受社会理论启发。我们的发现表明:(i)有害和侮辱是最常见的行为,分别以 16.13% 和 9.75% 的平均发生率;(ii)Qwen-VL-Chat、LLaVA-v1.6-Vicuna-7b 和 InstructBLIP-Vicuna-7b 是最脆弱的模型,分别表现出 21.50%、18.30% 和 17.90% 的有害响应率,以及 13.40%、11.70% 和 10.10% 的侮辱响应率;(iii)包含黑色幽默和多模态有害提示完成的提示策略显著提升了这些漏洞。尽管这些模型经过安全微调,但在针对对抗性输入进行提示时仍会生成不同程度的有害内容,这凸显了在 LVLMs 开发中迫切需要增强安全机制和稳健防御措施的紧迫性。
引用
@article{arxiv.2501.09039,
title = {Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models},
author = {Abdulkadir Erol and Trilok Padhi and Agnik Saha and Ugur Kursuncu and Mehmet Emin Aktas},
journal= {arXiv preprint arXiv:2501.09039},
year = {2025}
}