中文

良性到有毒越狱:从无害提示诱导有害响应

计算机视觉与模式识别 2025-05-29 v1 人工智能

摘要

基于优化的越狱通常在大型视觉语言模型(LVLMs)中采用有毒续写设置,遵循标准的下一词元预测目标。在此设置中,对抗图像被优化以使模型预测有毒提示的下一词元。然而,我们发现有毒续写范式在续写已有毒输入时很有效,但在缺乏明确有毒信号时却难以诱导安全失准。我们提出了一种新范式:良性到有毒(B2T)越狱。与以往工作不同,我们优化对抗图像以从良性条件诱导有毒输出。由于良性条件不包含安全违规,图像必须单独破坏模型的安全机制。我们的方法优于以往方法,在黑盒设置中具有可迁移性,并与基于文本的越狱互补。这些结果揭示了多模态对齐中一个未被充分探索的漏洞,并为越狱方法引入了一个根本性的新方向。

关键词

引用

@article{arxiv.2505.21556,
  title  = {Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts},
  author = {Hee-Seon Kim and Minbeom Kim and Wonjun Lee and Kihyun Kim and Changick Kim},
  journal= {arXiv preprint arXiv:2505.21556},
  year   = {2025}
}

备注

LVLM, Jailbreak