中文

SafeGRPO:基于规则引导的自奖励多模态安全对齐

密码学与安全 2025-11-18 v1 计算机视觉与模式识别

摘要

多模态大语言模型(MLLM)已展示出惊人的推理与指令遵循能力,但其扩展的模态空间引入了来自复杂文本-图像交互的新型组合性安全风险。此类跨模态耦合可即使在单个输入良好时也产生不安全的语义,暴露了当前 MLLM 安全意识的脆弱性。虽然近期研究通过引导模型对潜在风险进行推理来增强安全性,但未受管控的推理痕迹可能削弱对齐效果;虽然群相对政策优化(GRPO)提供了无需人工监督的自奖励精炼机制,但缺乏对推理安全性的可验证信号。为此,我们提出 SafeGRPO—a 集成规则引导奖励构建于 GRPO 之内的自奖励多模态安全对齐框架,实现推理安全性的可解释且可验证的优化。基于构建的带显式视觉、文本和组合安全标签的 SafeTag-VL-3K 数据集,SafeGRPO 执行分步引导的安全推理,以强制结构化推理与行为对齐,显著提升多模态安全意识、组合鲁棒性和推理稳定性,同时不牺牲通用能力。

关键词

引用

@article{arxiv.2511.12982,
  title  = {SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization},
  author = {Xuankun Rong and Wenke Huang and Tingfeng Wang and Daiguo Zhou and Bo Du and Mang Ye},
  journal= {arXiv preprint arXiv:2511.12982},
  year   = {2025}
}