通过部分感知监督防御 LVLMs 免受视觉攻击
计算机视觉与模式识别
2025-09-05 v2 人工智能
密码学与安全
摘要
最近的研究引起了人们对大型视觉语言模型(LVLMs)易受恶意注入或扰动的输入图像误导其响应的严重担忧。现有的防御方法表明,此类视觉攻击对图像修改(尤其是裁剪)很敏感,使用修改后图像的响应进行多数投票作为纠正后的响应。然而,这些修改通常会导致图像不完整并扭曲语义,从而降低了投票后干净图像上的响应质量。我们不直接使用部分图像的响应进行投票,而是研究使用它们来监督 LVLMs 对原始图像的响应。我们提出了一种称为 DPS(通过部分感知监督进行防御)的黑盒、免训练方法。在这种方法中,使用仅感知部分图像的模型生成的响应来提示模型。借助 DPS,模型在受到攻击时可以根据部分图像理解调整其响应,同时在干净输入时自信地保持其原始响应。我们的研究结果表明,弱模型可以监督强模型:当面临受攻击的输入时,强模型变得不那么自信,并根据弱模型的部分理解调整其响应,从而有效地防御攻击。对于干净输入,它自信地保持其原始响应。实验表明,我们的方法优于基线,在三个流行模型的六个数据集上将平均攻击成功率降低了 76.3%。
引用
@article{arxiv.2412.12722,
title = {Defending LVLMs Against Vision Attacks through Partial-Perception Supervision},
author = {Qi Zhou and Tianlin Li and Qing Guo and Dongxia Wang and Yun Lin and Yang Liu and Jin Song Dong},
journal= {arXiv preprint arXiv:2412.12722},
year = {2025}
}
备注
Accepted to ICML 2025