中文

OOD-MMSafe:从有害意图到隐藏后果的多模态大语言模型安全突破

人工智能 2026-03-11 v1

摘要

虽然针对多模态大语言模型(MLLM)的安全对齐已引起广泛关注,但当前方法主要针对恶意意图或情境违规。我们提出将安全边界转向后果导向的安全范式,这一范式对于自主式和具身智能体的可靠部署至关重要。为正式化化此转变,我们引入OOD-MMSafe,一个包含455个精心挑选的查询-图像对,旨在评估模型识别上下依赖因果链中潜在危险的能力。我们的分析揭示了前沿模型普遍存在的因果盲区,其中最高67.5%的模型在高容量闭源模型中失败,且识别出一种偏好极限,即静态对齐在模型容量增大时仅产生格式导向的失败,而非改善安全推理。为克服这些瓶颈,我们开发了后果感知安全策略优化(CASPO)框架,该框架将模型内在推理作为动态参考,用于token级别的自蒸馏奖励。实验结果表明,CASPO显著提升了后果预测能力,在Qwen2.5-VL-7B和Qwen3-VL-4B上将风险识别失败率分别降至7.3%和5.7%,同时保持整体有效性。

关键词

引用

@article{arxiv.2603.09706,
  title  = {OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences},
  author = {Ming Wen and Kun Yang and Jingyu Zhang and Yuxuan Liu and shiwen cui and Shouling Ji and Xingjun Ma},
  journal= {arXiv preprint arXiv:2603.09706},
  year   = {2026}
}

备注

30 pages