中文

TAIJI:视觉语言模型中针对越狱图像的文本锚定免疫

计算机视觉与模式识别 2025-03-25 v2 人工智能

摘要

视觉语言模型(VLMs)展示了令人印象深刻的推理能力,但仍然容易受到可诱导有害或不道德响应的越狱攻击。现有的防御方法主要是需要访问模型参数并进行大量修改的白盒方法,这使得它们在许多实际场景中成本高昂且不切实际。尽管已经提出了一些黑盒防御方法,但它们通常施加输入约束或需要多次查询,限制了它们在自动驾驶等安全关键任务中的有效性。为了应对这些挑战,我们提出了一种名为 \textbf{T}extual \textbf{A}nchoring for \textbf{I}mmunizing \textbf{J}ailbreak \textbf{I}mages (\textbf{TAIJI}) 的新型黑盒防御框架。TAIJI 利用基于关键短语的文本锚定来增强模型评估和缓解嵌入在视觉和文本提示中的有害内容的能力。与现有方法不同,TAIJI 在推理期间仅需单次查询即可有效运行,同时保持 VLM 在良性任务上的性能。大量实验表明,TAIJI 显著增强了 VLM 的安全性和可靠性,为实际部署提供了实用且高效的解决方案。

关键词

引用

@article{arxiv.2503.10872,
  title  = {TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models},
  author = {Xiangyu Yin and Yi Qi and Jinwei Hu and Zhen Chen and Yi Dong and Xingyu Zhao and Xiaowei Huang and Wenjie Ruan},
  journal= {arXiv preprint arXiv:2503.10872},
  year   = {2025}
}