中文

此图中有多少只独角兽?面向视觉大语言模型的安全评估基准

计算机视觉与模式识别 2023-11-28 v1 计算与语言 机器学习

摘要

本工作关注视觉大语言模型(VLLM)在视觉推理中的潜力。与先前研究不同,我们将焦点从评估标准性能转向引入一套全面的安全评估套件,涵盖分布外(OOD)泛化与对抗鲁棒性。对于 OOD 评估,我们提出两个新颖的 VQA 数据集,各带一个变体,旨在测试模型在挑战性条件下的表现。在探索对抗鲁棒性时,我们提出一种简单攻击策略,误导 VLLM 产生与视觉无关的响应。此外,我们评估两种越狱策略的有效性,分别针对 VLLM 的视觉或语言组件。我们对 21 个多样模型(从开源 VLLM 到 GPT-4V)的评估得出有趣观察:1)当前 VLLM 难以处理 OOD 文本而非图像,除非视觉信息有限;2)这些 VLLM 可仅通过欺骗视觉编码器被轻易误导,且其视觉-语言训练常损害安全协议。我们在 https://github.com/UCSC-VLAA/vllm-safety-benchmark 发布此安全评估套件。

关键词

引用

@article{arxiv.2311.16101,
  title  = {How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs},
  author = {Haoqin Tu and Chenhang Cui and Zijun Wang and Yiyang Zhou and Bingchen Zhao and Junlin Han and Wangchunshu Zhou and Huaxiu Yao and Cihang Xie},
  journal= {arXiv preprint arXiv:2311.16101},
  year   = {2023}
}

备注

H.T., C.C., and Z.W. contribute equally. Work done during H.T. and Z.W.'s internship at UCSC, and C.C. and Y.Z.'s internship at UNC