玩弄愚蠢:通过超出分布策略劫持LLM和多模态LLM
密码学与安全
2025-03-28 v1
摘要
尽管大型语言模型(LLMs)和多模态LLM(MLLMs)在语言和视觉任务上具备惊人的可泛化能力,但LLMs和MLLMs显示出对劫持的脆弱性,在面对有害或敏感输入时会生成违反安全、伦理和偏见标准的文本输出。随着通过偏好调校从人类反馈实现的安全对齐技术的近期进步,LLMs和MLLMs已被配置为就有害输入提供安全、伦理且公平的响应。然而,尽管安全对齐具有重要意义,但关于其漏洞的研究仍在很大程度上未被探索。本文检讨了安全对齐的未探索漏洞,考察其为超出分布(OOF)化的有害输入提供安全保证能力,这些输入可能落在对齐数据分布之外。我们的关键观察是,OOF-化纯粹有害输入会显著增加模型区分输入中恶意意图的不确定性,从而增加被劫持的可能性。利用这一漏洞,我们提出了一种新的劫持框架JOOD,通过OOF-化超出安全对齐的输入。我们探索了各种开源视觉和文本转换技术用于OOF-化有害输入。值得注意的是,我们发现即使是简单的基于混合的技术,如图像混合(image mixup),在增加模型不确定性方面也非常有效,从而促进了安全对齐的绕过。实验在多样化的劫持场景中表明,JOOD有效地劫持了最近的专有LLMs和MLLMs,如GPT-4和o1,具有高攻击成功率,而以往的攻击方法一直在劫持这些模型方面困难。代码可在https://github.com/naver-ai/JOOD获取。
引用
@article{arxiv.2503.20823,
title = {Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution Strategy},
author = {Joonhyun Jeong and Seyun Bae and Yeonsung Jung and Jaeryong Hwang and Eunho Yang},
journal= {arXiv preprint arXiv:2503.20823},
year = {2025}
}
备注
Accepted at CVPR2025