Seg-R1:分段能力意外地简单——基于强化学习
计算机视觉与模式识别
2025-07-01 v1
摘要
我们提出了 Seg-R1,这是对使用强化学习(RL)增强大型多模态模型(LMM)像素级理解与推理能力的初步探索。从前景分段任务出发,具体包括伪装物体检测(COD)和显著物体检测(SOD),我们的方法使 LMM 能够以下一词的方式生成点和边界框提示,这些提示随后用于指导 SAM2 生成分段掩码。我们将群相对策略优化(GRPO)引入分段领域,通过精心设计的训练策略为 LMM 赋予像素级理解能力。值得注意的是,Seg-R1 仅通过纯粹的 RL 训练即可实现卓越的性能,在 COD10K 上达到 .873 的 S-measure 指标。此外,我们发现纯 RL 训练在开放世界泛化方面表现出色。尽管仅在无文本监督的前景分段图像-掩码对上进行训练,Seg-R1 仍在指代分段和推理分段任务上实现惊人的零样性能,分别在 RefCOCOg 测试集上达到 71.4 的 cIoU,在 ReasonSeg 测试集上达到 56.7 的 gIoU,超越了在这些数据集上完全监督训练的模型。
引用
@article{arxiv.2506.22624,
title = {Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement Learning},
author = {Zuyao You and Zuxuan Wu},
journal= {arXiv preprint arXiv:2506.22624},
year = {2025}
}