隐藏、重建、越狱:利用 MLLM 中的重建-隐藏权衡进行攻击
人工智能
2026-05-08 v1
摘要
意图混淆式越狱攻击针对多模态大语言模型(MLLMs)将有害查询转化为隐蔽的多模态输入,以规避安全机制。我们展示此类攻击受制于一种 reconstruction-concealment 权衡:转换后的输入必须在安全过滤器之外隐藏有害意图,同时仍需足够可恢复,以便受害模型重建原始请求。通过对三个代表性黑盒方法的重建分析,我们发现现有转换方法在平衡这一权衡方面困难,限制了其有效性。相比之下,我们发现字符删除变体在平衡方面更优。基于此,我们提出了 concealment-aware variant construction,即贪婪选择低于有害关键词对齐且两两多样性强的字符删除变体,并通过五种模态感知式提示策略实现它们。我们进一步引入了 keyword-related distractor images,即描绘有害关键词在多种情境下的图像,提供比通用干扰图像更有效的辅助视觉上下文。实验在封闭源和开源 MLLMs 上表明,我们提出的策略在强大基准上表现更优,揭示了一种未被充分探索的脆弱性:模型自身的重建能力可以被利用来恢复隐藏的有害意图并生成不安全的响应。
引用
@article{arxiv.2605.05709,
title = {Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs},
author = {Md Farhamdur Reza and Richeng Jin and Tianfu Wu and Huaiyu Dai},
journal= {arXiv preprint arXiv:2605.05709},
year = {2026}
}
备注
39 pages, including appendices