SAM-R1:基于强化学习在多模态分割中利用 SAM 进行奖励反馈
计算机视觉与模式识别
2026-03-17 v2
摘要
利用多模态大模型进行图像分割已成为一个重要的研究方向。然而,现有方法通常严重依赖包含显式推理过程的人工标注数据集,这类数据集的生产既昂贵又耗时。最近的进展表明,强化学习 (RL) 能够在不依赖此类推理标注数据的情况下赋予大模型推理能力。在本文中,我们提出了 SAM-R1,这是一个新颖的框架,使多模态大模型能够在图像理解任务中执行细粒度推理。我们的方法首次在多模态推理模型的训练中引入了细粒度分割设置。通过将特定任务的细粒度奖励与量身定制的优化目标相结合,我们进一步增强了模型的推理与分割对齐能力。我们还利用 Segment Anything Model (SAM) 作为强大且灵活的奖励提供者来指导学习过程。仅使用 3k 训练样本,SAM-R1 便在多个基准测试中取得了强劲的性能,证明了强化学习在赋予多模态模型面向分割的推理能力方面的有效性。
引用
@article{arxiv.2505.22596,
title = {SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning},
author = {Jiaqi Huang and Zunnan Xu and Jun Zhou and Ting Liu and Yicheng Xiao and Mingwen Ou and Bowen Ji and Xiu Li and Kehong Yuan},
journal= {arXiv preprint arXiv:2505.22596},
year = {2026}
}
备注
Accepted to NeurIPS 2025