AM$^3$Safety:面向多模态多回合安全对齐的数据高效方法
计算与语言
2026-01-09 v1
摘要
多模态大语言模型(MLLM)正在被部署到交互式应用中,但在多回合多模态场景下其安全漏洞尤为突出,恶意意图可跨回合逐步重构,安全协议在对话进程中会逐渐淡化。现有的基于人类反馈强化学习(RLHF)对齐方法主要是为单回合视觉问答(VQA)任务开发的,往往需要高成本的人工偏好标注,限制了其在对话场景中的有效性和可扩展性。为此,本文提出InterSafe-V,一个包含11,270个对话和500个特别设计的拒绝式VQA样本的开源多模态对话数据集。该数据集通过多个模型之间的交互构建,旨在更准确地反映真实场景,并包括针对特定领域的专门VQA配对。基于此数据集,我们提出AMSafety框架,结合冷启动拒绝阶段和基于整体对话的轮转策略优化(GRPO)微调,使用跨回合双目标奖励。在Qwen2.5-VL-7B-Instruct和LLaVA-NeXT-7B上实验表明,AMSafety在保持模型通用能力的前提下,使多模态多回合安全基准中的攻击成功率(ASR)下降超过10%,在无害维度提升至少8%,在有用维度提升超过13%。
引用
@article{arxiv.2601.04736,
title = {AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs},
author = {Han Zhu and Jiale Chen and Chengkun Cai and Shengjie Sun and Haoran Li and Yujin Zhou and Chi-Min Chan and Pengcheng Wen and Lei Li and Sirui Han and Yike Guo},
journal= {arXiv preprint arXiv:2601.04736},
year = {2026}
}