面向无害性多模态助手的盲目偏好优化
计算与语言
2025-03-19 v1 计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)在多模态理解、推理和交互方面展现了惊人的能力。鉴于 MLLMs 的广泛应用,其安全问题日益严峻。鉴于偏好优化在与人类偏好对齐 MLLMs 方面的有效性,迫切需要为 MLLMs 提供与安全相关的偏好数据。为此,我们构建了面向无害性多模态助手的 MMSafe-PO 偏好数据集,包含多模态指令、对话格式以及来自人类反馈的排序化成对响应。我们还识别了两个具有洞察力的观察:模态共防御和模态作弊,说明 MLLMs 具备一定的内在防御能力,同时仍然呈现出独特的安全挑战。基于这些观察,我们提出了盲目偏好优化(BPO)方法。在三个基准测试上的全面实验表明,BPO 有效提升了 MLLMs 的安全能力。值得注意的是,BPO 将基础 MLLM 的安全率提高了 45.0%,超越了 DPO 方法。此外,将 BPO 应用于 MMSafe-PO 数据集可大幅降低基础 MLLM 在其他安全基准(MM-SafetyBench 上的 14.5%,HarmEval 上的 82.9%)上的不安全率,显示出该数据集和方法的有效性和鲁棒性。我们在 https://lu-yang666.github.io/MMsafe-PO-Web/ 上发布代码和数据。
引用
@article{arxiv.2503.14189,
title = {Towards Harmless Multimodal Assistants with Blind Preference Optimization},
author = {Yongqi Li and Lu Yang and Jian Wang and Runyang You and Wenjie Li and Liqiang Nie},
journal= {arXiv preprint arXiv:2503.14189},
year = {2025}
}