中文

安全单模输入碰撞时:优化跨模态大语言模型的推理链

人工智能 2025-09-17 v2

摘要

多模态大语言模型(MLLM)易受到隐式推理风险的威胁,即看似无害的单模态输入 synergistically 组合成产生有害输出的风险多模态数据。我们将这一脆弱性归因于MLLM在长链推理中难以保持安全对齐。为此,我们提出Safe-Semantics-but-Unsafe-Interpretation(SSUI),首个针对此跨模态挑战的可解释推理路径数据集。我们还基于SSUI数据集设计了新的训练框架Safety-aware Reasoning Path Optimization(SRPO),以将MLLM的内部推理过程与人类安全价值对齐。实验结果表明,我们的SRPO训练模型在关键安全基准测试中实现了最新进展,包括提出的推理路径基准(RSBench),显著优于开源和顶级商业MLLM。

关键词

引用

@article{arxiv.2509.12060,
  title  = {When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models},
  author = {Wei Cai and Shujuan Liu and Jian Zhao and Ziyan Shi and Yusheng Zhao and Yuchen Yuan and Tianle Zhang and Chi Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2509.12060},
  year   = {2025}
}