越界中的无辜:跳过连接在作弊视觉语言模型中扮演的角色
计算与语言
2025-07-21 v1
摘要
语言模型对提示表述极其敏感——即使是微小的输入变化也会极大地改变其输出。这引出了一个关键问题:提示敏感性在多大程度上可以被利用以生成不当内容?本文我们研究了提示设计的离散组件如何影响视觉语言模型(VLMs)中不当内容的生成。具体而言,我们分析了三个关键因素对成功作弊的影响:(a)包含详细视觉信息;(b)存在对抗性示例的存在;(c)使用积极表述开头短语。我们的发现表明,尽管VLMs在单模态环境中(文本-only或图像-only)能够可靠地区区 benign和有害输入,但在多模态情境下的区分能力显著下降。三个因素各自都可以独立触发作弊,我们进一步表明,即使只有三个小样本的原子示例(in-context examples)也足以推动模型生成不当输出。此外,我们提出了一种框架利用VLMs两个内部层之间的跳过连接(skip-connection),显著提高了作弊成功率,即使使用良性图像亦然。最后,我们展示了 memes——常被视为幽默或无害的图像——在引发有害内容方面的效果不亚于有毒图像,凸显了VLMs细微且复杂的脆弱性。
引用
@article{arxiv.2507.13761,
title = {Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models},
author = {Palash Nandi and Maithili Joshi and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2507.13761},
year = {2025}
}