Saliency-R1:基于置信度引导的强化学习激励多模态大语言模型统一视觉注意力推理能力
计算机视觉与模式识别
2025-11-27 v3
摘要
尽管多模态大语言模型(MLLM)在高层次视觉语言推理方面表现出色,但缺乏对视觉注意力的内在意识,难以识别关键视觉元素。为弥合这一差距,我们提出Saliency-R1,是首个统一MLLM框架,联合解决三个代表性且异构的注意力任务:显著物体检测(SOD)、显著实例分割(SIS)和共显著物体检测(CoSOD),以增强模型的注意力推理能力。我们引入带结构标签(<rg>、<ins>)的文本界面,用于编码区域级和实例级指代表达式,使单一指代分割器能够生成适当的掩码。为高效训练MLLM,我们提出置信度引导策略优化(CGPO)——一种新型单样本强化学习算法。CGPO在GRPO基础上,将组归一化优势替换为基于奖励-置信度偏差的 per-sample信号,从而减少计算浪费,缓解信号稀释,降低训练开销。我们模型在所有三个任务上均超过或匹配了鲁棒的开源/闭源MLLM和专用最新方法的性能,展示了我们框架在注意力推理中的有效性。
引用
@article{arxiv.2511.00396,
title = {Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning},
author = {Long Li and Shuichen Ji and Ziyang Luo and Zhihui Li and Dingwen Zhang and Junwei Han and Nian Liu},
journal= {arXiv preprint arXiv:2511.00396},
year = {2025}
}
备注
Main text (excluding references): 8 pages, 4 figures; Supplementary Materials (excluding references): 9 pages, 10 figures