思考安全性:揭示多模态大推理模型中的安全对齐崩溃及其缓解方法
计算与语言
2025-10-14 v4
摘要
多模态大推理模型(MLRMs)的快速发展展现出广泛的应用潜力,但其安全性和可靠性仍是亟需系统性探索的关键问题。为此,我们对11个多模态大推理模型进行了全面且系统的安全评估,评估覆盖5个基准测试,揭示了绝大多数先进模型中普遍存在的安全性能下降现象。此外,我们的分析发现不同基准测试之间呈现出不同的安全模式:在越狱鲁棒性基准测试中观察到显著的安全性能下降,而在安全意识基准测试中则表现出较小的性能退化。特别地,在某些场景下,较长的思考过程甚至可以提升安全性能。因此,通过利用模型内在的推理能力来检测不安全意图,可能是解决MLRMs安全问题的潜在方法。为实现这一洞见,我们构建了一个包含安全导向思考过程的多模态调优数据集。实验结果表明,使用该数据集对现有MLRMs进行微调,可有效提升其在越狱鲁棒性和安全意识基准测试中的安全性能。这一研究为开发安全的MLRMs提供了新的视角。我们的数据集已公开于 https://github.com/xinyuelou/Think-in-Safety。
引用
@article{arxiv.2505.06538,
title = {Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model},
author = {Xinyue Lou and You Li and Jinan Xu and Xiangyu Shi and Chi Chen and Kaiyu Huang},
journal= {arXiv preprint arXiv:2505.06538},
year = {2025}
}
备注
Accepted by EMNLP 2025 (main)