模拟集体攻击:跨微调视觉语言模型的越狱迁移
计算机视觉与模式识别
2026-01-15 v3
摘要
面向开源视觉语言模型(VLM)的微调实践广泛存在,引发关键安全隐患:基座模型中的越狱漏洞可能在下游变体中持续存在,使跨系统攻击具有可传递性。为调查此风险,我们提出模拟集体攻击(SEA),一个假设获取基座VLM完全访问权但无知识目标微调模型的灰盒越狱框架。SEA通过微调轨迹模拟(FTS)增强可传递性,该方法建模视觉编码器的受限参数变化;通过目标提示引导(TPG)稳定对抗优化。实验在Qwen2-VL系列中表明,SEA在各类微调变体上实现持续高的传递成功率和毒性率,包括安全增强模型,而标准PGD-based图像越狱则表现可忽略。进一步分析揭示,微调主要导致基座模型周围的局部参数位移,这解释了为何针对模拟邻域优化的攻击有效传递。我们还展示了SEA跨不同基座生成(如Qwen2.5/3-VL)的普遍性,表明其有效性源于共享的微调诱导行为而非特定于架构或初始化的因素。
引用
@article{arxiv.2508.01741,
title = {Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models},
author = {Ruofan Wang and Xin Wang and Yang Yao and Juncheng Li and Xuan Tong and Xingjun Ma},
journal= {arXiv preprint arXiv:2508.01741},
year = {2026}
}