破解 LLM 与 VLM:机制、评估与统一防御
密码学与安全
2026-01-08 v1
摘要
本文对大语言模型(LLM)和视觉语言模型(VLM)上的破解攻击与防御进行系统性调查,强调破解漏洞源于结构性因素,如训练数据不完整、语言模糊和生成不确定性。进一步区分了幻觉与破解的意图和触发机制。我们提出了一个三维调查框架:(1)攻击维度-包括模板/编码-based、基于情境学习的操纵、强化/对抗学习、LLM 辅助和微调攻击,以及提示和图像级扰动以及基于智能体的迁移在 VLM 中;(2)防御维度-涵盖提示级混淆、输出评估以及模型级对齐或微调;(3)评估维度-涵盖攻击成功率(ASR)、毒性得分、查询/时间成本以及多模态干净准确率和属性成功率。与先前工作相比,本次调查涵盖了从文本-only 到多模态设置的完整范围,整合了共享机制并提出了统一防御原则:在感知层采用变体一致性和梯度灵敏度检测,在生成层实施安全感知解码和输出审查,在参数层进行对抗性增强的偏好对齐。此外,我们总结了现有的多模态安全基准并讨论了未来方向,包括自动化红队测试、跨模态协作防御以及标准化评估。
引用
@article{arxiv.2601.03594,
title = {Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense},
author = {Zejian Chen and Chaozhuo Li and Chao Li and Xi Zhang and Litian Zhang and Yiming He},
journal= {arXiv preprint arXiv:2601.03594},
year = {2026}
}