COSMO-RL:通过联合安全性与稳定性实现可信赖的大型多模态推理模型
人工智能
2025-10-07 v1 机器学习
摘要
大型多模态推理模型(LMRMs)正逐步进入实际应用场景,必须兼具实用性与安全性。在多模态环境中,安全性尤为具有挑战性:图像和文本可以组合规避警戒措施,单一目标训练可能导致策略漂移,引起对良性输入的过度拒绝或对高风险输入的不安全从容。我们提出了 COSMO-RL,一种混合强化学习框架,用于在多模态、多任务和多目标信号下训练具推理导向特性的 LMRM。我们发布了 resulting model,COSMO-R1。我们的 метод旨在让安全性与能力在一个稳定的管道中同步成长,而非在对齐过程中发生竞争。在实验中,COSMO-R1 在保持甚至常常提升多模态推理和指令遵循能力的同时,改善了安全性,显示出对多模态越狱攻击的更强鲁棒性,以及减少不必要的拒绝。该框架在不同 backbone 之间也能保持一致的收益。消融实验支持我们的设计选择,表明这是一条通往在 LMRM 中同步提升安全性与通用能力的简单路径。
引用
@article{arxiv.2510.04196,
title = {COSMO-RL: Towards Trustworthy LMRMs via Joint Safety and Stability},
author = {Yizhuo Ding and Mingkang Chen and Qiuhua Liu and Fenghua Weng and Wanying Qu and Yue Yang and Yugang Jiang and Zuxuan Wu and Yanwei Fu and Wenqi Shao},
journal= {arXiv preprint arXiv:2510.04196},
year = {2025}
}