模型如积木:通过语义蓝图从良性模块组装恶意内容
计算机视觉与模式识别
2026-03-10 v1 机器学习
摘要
尽管大型视觉语言模型(LVLMs)取得了快速进展,但视觉模态的集成引入了新的安全漏洞, adversary 可利用以触发偏见或恶意输出。本文通过语义插槽填充展示了一种被忽视的漏洞:LVLMs在槽位类型被精心设计看似良性时,仍会用不安全内容完成缺失的槽位值。基于此发现,我们提出StructAttack,即一种在黑盒设置下简单的有效单查询“越狱”框架。StructAttack将有害查询分解为中心主题和一组看似良性的槽位类型,然后将其嵌入带有小随机扰动的结构化视觉提示(如思维导图、表格或旭日图),并配合完成导向指令,使LVLMs自动重组隐藏的语义并生成不安全的输出,而不触发安全机制。尽管每个槽位在孤立时看似良性(局部良性),StructAttack却利用LVLMs的推理能力将这些槽位组装成连贯的恶意语义。多模型和多个基准测试的广泛实验表明,我们提出的方法具有有效性。
引用
@article{arxiv.2603.07590,
title = {Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints},
author = {Chenxi Li and Xianggan Liu and Dake Shen and Yaosong Du and Zhibo Yao and Hao Jiang and Linyi Jiang and Chengwei Cao and Jingzhe Zhang and RanYi Peng and Peiling Bai and Xiande Huang},
journal= {arXiv preprint arXiv:2603.07590},
year = {2026}
}