DefenSee:从视觉与文本中解析威胁 —— 面向多模态越狱的多视图防御管线
密码学与安全
2025-12-19 v1
摘要
多模态大语言模型(MLLMs)能够处理文本、图像和音频,已广泛应用于各种 AI 应用。然而,近期集成图像和文本的 MLLMs 仍高度脆弱面对协同式越狱攻击。现有防御主要聚焦文本,缺乏健壮的多模态保护。结果表明,MLLMs 对恶意或不安全指令的易受性高于其文本专用模型。在本文中,我们提出了 DefenSee,一种稳健且轻量级的多模态黑盒防御技术,利用图像变体转录和跨模态一致性检查,模拟人类判断。实验在流行的多模态越狱和良性数据集上进行,表明 DefenSee 在提升 MLLM 鲁棒性方面始终优于当前方法,同时在良性任务上保留性能更佳。它将 MiniGPT4 使用 MM-SafetyBench 数据集基准下的越狱攻击成功率(ASR)降至 1.70% 以下,显著优于相同条件下的先前方法。
引用
@article{arxiv.2512.01185,
title = {DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks},
author = {Zihao Wang and Kar Wai Fok and Vrizlynn L. L. Thing},
journal= {arXiv preprint arXiv:2512.01185},
year = {2025}
}