中文

CeTAD:面向 Vision Language 模型的可认证毒性感知距离

计算机视觉与模式识别 2025-03-25 v2

摘要

近期大型视觉语言模型 (VLM) 的进展在广泛的视觉理解任务中展现了显著的成功。然而,这些模型对越狱攻击的鲁棒性仍是一个开放的挑战。本文提出了一个通用的可认证防御框架,严格保护 VLM 免受潜在的视觉越狱攻击。首先,我们提出了一种新颖的距离度量方法,用于量化恶意响应与预期响应之间的语义差异,捕捉常被余弦相似度等常规措施忽略的细微差异。随后,我们设计了一种回归认证方法,利用随机光滑化技术在面对黑盒设置下,对抗性和结构性扰动提供形式化鲁棒性保证。此外,我们的特征空间防御引入噪声分布(如高斯分布、拉普拉斯分布)到潜在嵌入中,以保护免受像素级和结构级扰动。我们的结果凸显了在构建更具韧性和可信赖性 VLM 方面,基于形式化依托的集成策略的潜力。

关键词

引用

@article{arxiv.2503.10661,
  title  = {CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models},
  author = {Xiangyu Yin and Jiaxu Liu and Zhen Chen and Jinwei Hu and Yi Dong and Xiaowei Huang and Wenjie Ruan},
  journal= {arXiv preprint arXiv:2503.10661},
  year   = {2025}
}