DREAM:通过分离风险来增强多模态大语言模型的安全对齐
计算与语言
2025-06-06 v2 计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)由于整合视觉与文本数据,带来独特的安全挑战,从而引入新的攻击维度和复杂的风险组合。在本文中,我们首先进行详细分析,旨在通过多步推理在多模态输入中分离风险。我们发现,系统性的多模态风险分离显著增强了 MLLMs 的风险意识。通过利用多模态风险分离的强大判别能力,我们进一步引入 DREAM(Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models),通过监督微调和迭代强化学习从 AI 反馈(RLAIF)来增强 MLLMs 的安全对齐。实验结果表明,DREAM 在推理和训练阶段均显著提升了安全性,而不会损害正常任务(即避免过度安全)的性能,相较于 GPT-4V 实现了 16.17% 的 SIUO safe\&effective 分数提升。数据和代码已公开于 https://github.com/Kizna1ver/DREAM。
引用
@article{arxiv.2504.18053,
title = {DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models},
author = {Jianyu Liu and Hangyu Guo and Ranjie Duan and Xingyuan Bu and Yancheng He and Shilong Li and Hui Huang and Jiaheng Liu and Yucheng Wang and Chenchen Jing and Xingwei Qu and Xiao Zhang and Yingshui Tan and Yanan Wu and Jihao Gu and Yangguang Li and Jianke Zhu},
journal= {arXiv preprint arXiv:2504.18053},
year = {2025}
}
备注
[NAACL 2025] The first four authors contribute equally, 23 pages, repo at https://github.com/Kizna1ver/DREAM