安全 RLHF-V:多模态人类反馈安全强化学习
机器学习
2025-05-23 v2 人工智能
摘要
多模态大语言模型(MLLMs)是构建通用人工智能助手的关键,但正日益增加安全风险。如何确保 MLLMs 的安全对齐以防止不所需的行为?更关键的是,在满足安全约束的同时如何微调 MLLMs 以保留其能力。从根本上说,这一挑战可以形式化为一个最小-最大优化问题。然而,现有数据集尚未将单一偏好信号分解为明确的安全约束,阻碍了以此方向进行系统性调查。此外,是否能够有效地将此类约束纳入多模态模型的优化过程中仍是一个开放问题。本文提出了首个多模态安全对齐框架 Safe RLHF-V,该框架包括: BeaverTails-V,即首个包含双重偏好注释(有用性和安全性)的数据集, supplemented with 多级安全标签(轻微、适度、严重); Beaver-Guard-V,一种多级警戒系统,用于主动防御不安全查询和对抗性攻击。通过对五轮过滤和再生成的应用,显著提升了前身模型的整体安全性,平均提升 40.9%。 基于双重偏好,我们首次探索了受约束下的多模态安全对齐。实验结果表明,Safe RLHF 在提高模型的有用性和安全性方面均有效。具体而言,Safe RLHF-V 将模型的安全性提升 34.2%,有用性提升 34.3%。
引用
@article{arxiv.2503.17682,
title = {Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback},
author = {Jiaming Ji and Xinyu Chen and Rui Pan and Conghui Zhang and Han Zhu and Jiahao Li and Donghai Hong and Boyuan Chen and Jiayi Zhou and Kaile Wang and Juntao Dai and Chi-Min Chan and Yida Tang and Sirui Han and Yike Guo and Yaodong Yang},
journal= {arXiv preprint arXiv:2503.17682},
year = {2025}
}