Seg-Zero:基于认知强化的推理链引导分割
计算机视觉与模式识别
2025-07-01 v2 多媒体
摘要
传统的推理分割方法依赖于带有类别标签和简单描述的监督微调,限制了其域外泛化能力且缺乏显式的推理过程。为了解决这些局限性,我们提出了 Seg-Zero,这是一种新颖的框架,通过认知强化展现出卓越的泛化能力并推导出显式的思维链推理。Seg-Zero 引入了一个由推理模型和分割模型组成的解耦架构。推理模型解释用户意图,生成显式的推理链,并产生位置提示,随后分割模型利用这些提示生成精确的像素级掩码。我们设计了一种复杂的奖励机制,结合了格式奖励和准确性奖励,以有效引导优化方向。Seg-Zero 完全通过强化学习与 GRPO 进行训练,无需显式的推理数据,实现了稳健的零样本泛化,并展现出涌现的测试时推理能力。实验表明,Seg-Zero-7B 在 ReasonSeg 基准上实现了 57.5 的零样本性能,超越了先前的 LISA-7B 18%。这一显著提升突显了 Seg-Zero 跨域泛化的能力,同时呈现了显式的推理过程。代码可在 https://github.com/dvlab-research/Seg-Zero 获取。
引用
@article{arxiv.2503.06520,
title = {Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement},
author = {Yuqi Liu and Bohao Peng and Zhisheng Zhong and Zihao Yue and Fanbin Lu and Bei Yu and Jiaya Jia},
journal= {arXiv preprint arXiv:2503.06520},
year = {2025}
}