中文

RCoT-Seg:用于视频推理和分割的强化链式思维

计算机视觉与模式识别 2026-05-11 v1

摘要

视频推理分割(VRS)旨在基于隐式指令(传递人类意图和时间逻辑)对视频中的目标对象进行分割。现有的多模态大语言模型(MLLM)方法通过简单抽样或辅助MLLM选择帧后预测[SEG]标记,其中受限的监督和帧-语言相似性规则常导致选择范围受限的关键帧,从而削弱整体时间理解并在复杂多目标场景中导致脆弱的局部化。在这些问题的解决下,我们引入RCoT-Seg,一个视频思维框架,将VRS分解为时间视频推理(TVR)和关键帧目标感知(KTP),显式分离时间推理与空间感知。在TVR阶段,提出一个具有代理性质的关键帧选择模块,该模块以精选的CoT-start语料库为初始化,并通过任务对齐奖励进行GRPO优化,以生成并重新选择关键帧,强化时刻局部化和时间推理。在KTP阶段,RCoT-Seg对选定帧执行高分辨率分割,并通过基于SAM2的方法在序列上传播掩码,取代启发式抽样和外部选择器,同时提高空间精度和帧间一致性。大量实验结果表明,所提出的RCoT-Seg在与最新方法的对比中实现了 favorable 性能。代码和模型将在https://github.com/Victor-wjw/RCoT-Seg上公开发布。

关键词

引用

@article{arxiv.2605.07334,
  title  = {RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation},
  author = {Junwei Wen and Deshui Miao and Guangming Lu and Xin Li and Wenjie Pei},
  journal= {arXiv preprint arXiv:2605.07334},
  year   = {2026}
}

备注

21 pages