中文

(几乎)零成本的安全微调:视觉大语言模型的基线

机器学习 2024-06-19 v2

摘要

当前的视觉大语言模型(VLLMs)展现出卓越的能力,却容易生成有害内容,且极易受到甚至最简单的越狱攻击。我们的初步分析发现,这是由于在视觉-语言指令微调期间存在有害数据,并且 VLLM 微调会导致遗忘底层 LLM 先前学习到的安全对齐。为了解决这个问题,我们首先策划了一个涵盖各种有害类别的视觉-语言安全指令遵循数据集 VLGuard。我们的实验表明,将此数据集整合到标准视觉-语言微调中或将其用于事后微调,能有效地对 VLLMs 进行安全对齐。这种对齐在对模型有用性影响极小甚至有所提升的情况下实现。我们的安全微调数据集具有多功能性,使其成为安全测试现有 VLLMs、训练新模型或保护预训练 VLLMs 的宝贵资源。实证结果表明,微调后的 VLLMs 能有效拒绝不安全指令,并大幅降低多种黑盒对抗攻击的成功率,在许多情况下降至接近零。代码和数据集可在 https://github.com/ys-zong/VLGuard 获取。

关键词

引用

@article{arxiv.2402.02207,
  title  = {Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models},
  author = {Yongshuo Zong and Ondrej Bohdal and Tingyang Yu and Yongxin Yang and Timothy Hospedales},
  journal= {arXiv preprint arXiv:2402.02207},
  year   = {2024}
}

备注

ICML 2024