中文

SaFeR-Steer:通过合成引导与反馈动力学演化多轮多模态大语言模型

机器学习 2026-05-28 v2 计算与语言

摘要

多模态大语言模型(MLLMs)正在部署到多轮场景中,攻击者可通过不断演化的视觉-文本历史来升级不安全意图,并利用长上下文安全衰减进行利用。然而,安全对齐仍主要依赖单轮数据和固定模板对话,训练与部署之间存在不匹配。为弥合这一差距,我们提出了SaFeR-Steer,这是一个结合阶段性合成引导与 tutor-in-the-loop GRPO 的渐进式多轮对齐框架,用于在自适应、基于策略的攻击下训练单个学生。我们还引入了轨迹一致求和奖励(TCSR),其聚合了回合奖励的历史最小值为和平均值,以确保任何低质量回合都会影响轨迹级别的返回。数据集部分:我们发布了STEER,一个包含STEER-SFT(12,934)、STEER-RL(2,000)和STEER-Bench(3,227)三类对话的多轮多模态安全数据集,涵盖2-10轮对话。实验部分:从Qwen2.5-VL-3B/7B开始,SaFeR-Steer在单轮(3B模型:48.30/45.86 → 81.84/70.77;7B模型:56.21/60.32 → 87.89/77.40)和多轮(3B模型:12.55/27.13 → 55.58/70.27;7B模型:24.66/46.48 → 64.89/72.35)基准上显著提升了安全性/有用性,使失败情况转移到后续回合,仅靠规模无法实现的鲁棒性得以提升。代码已公开于https://anonymous.4open.science/r/SaFeR-Steer

关键词

引用

@article{arxiv.2604.16358,
  title  = {SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics},
  author = {Haolong Hu and Hanyu Li and Tiancheng He and Huahui Yi and An Zhang and Qiankun Li and Kun Wang and Yang Liu and Zhigang Zeng},
  journal= {arXiv preprint arXiv:2604.16358},
  year   = {2026}
}