MSR-Align: 面向视觉-语言模型安全推理的策略引导多模态对齐
计算机视觉与模式识别
2025-10-22 v2 计算与语言
摘要
视觉-语言模型(VLM)通过增强的思维链能力,在多模态推理任务中取得了显著进展。然而,这种进步也带来了新的安全风险,因为这些模型越来越容易受到有害多模态提示的攻击,从而引发不道德或不安全的行为。现有的安全对齐方法主要针对单模态语言模型设计,在应对多模态输入带来的复杂且微妙的威胁方面存在不足。此外,当前的安全数据集缺乏支持推理型VLM鲁棒对齐所需的细粒度、策略引导的推理能力。在这项工作中,我们引入了{MSR-Align},这是一个高质量的多模态安全推理数据集,旨在弥合这一差距。MSR-Align支持在视觉和文本两种模态上,根据标准化安全策略进行细粒度的审慎推理。我们的数据生成流程强调多模态多样性、策略引导推理,并使用强大的多模态评判器进行严格的质量过滤。大量实验表明,在MSR-Align上微调VLM能显著提升其对文本和视觉-语言越狱攻击的鲁棒性,同时保持或增强其通用推理性能。MSR-Align为推进推理型VLM的安全对齐提供了一个可扩展且有效的基础。我们的数据集已在 https://huggingface.co/datasets/Leigest/MSR-Align 公开。
引用
@article{arxiv.2506.19257,
title = {MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models},
author = {Yinan Xia and Yilei Jiang and Yingshui Tan and Xiaoyong Zhu and Xiangyu Yue and Bo Zheng},
journal= {arXiv preprint arXiv:2506.19257},
year = {2025}
}