视觉语言模型安全精调中的瓶颈重思考
计算机视觉与模式识别
2026-02-04 v3 计算与语言
密码学与安全
摘要
大型视觉语言模型(VLM)在广泛的任务中取得了显著的性能,但其在安全关键领域的部署面临着显著挑战。现有的安全精调方法侧重于文本或多模态内容,难以处理棘手案例,或会破坏有帮助性与无害性之间的平衡。我们的评估突显了安全推理差距:这些方法缺乏安全视觉推理能力,导致存在瓶颈。为解决这一局限并提升安全关键情境下的视觉感知与推理能力,我们提出了包含多图像输入与安全链式思维(CoT)标签的新型数据集,以细化推理逻辑提升模型性能。具体而言,我们引入了多图像安全(MIS)数据集,专为多图像安全情境设计的指令遵循数据集,包含训练和测试 split。我们的实验表明,使用 MIS 对 InternVL2.5-8B 进行精调,在需要安全相关视觉推理的挑战性多图像任务中显著优于强大的开源模型和 API-based 模型。该方法不仅提供了卓越的安全性能,还在没有任何权衡的情况下保留了通用能力。具体而言,使用 MIS 进行精调后,五个通用基准的平均准确率提高了 0.83%,并在多个安全基准上将攻击成功率(ASR)大幅降低。
引用
@article{arxiv.2501.18533,
title = {Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models},
author = {Yi Ding and Lijun Li and Bing Cao and Jing Shao},
journal= {arXiv preprint arXiv:2501.18533},
year = {2026}
}