基于锚定描述的判别式感知:用于推理分段
计算机视觉与模式识别
2026-03-05 v1 人工智能
摘要
推理分段日益采用强化学习生成引导多模态大语言模型的解释推理链。虽然这些几何奖励主要局限于指导最终局部化,但无法判别推理过程是否保持锚定于所指区域或偏离到无关上下文。缺乏这种判别性指导,模型的推理常常退化为非聚焦且冗长的推理链,最终无法在复杂场景中消除歧义并感知目标。这表明需要为判别式感知补充 RL 目标,即主动区分目标与其上下文的能力。为实现这一目标,我们提出 DPAD,以迫使模型生成所指对象的描述性标题,然后用于通过对比标题的语义相关性与所指对象相对于更广阔上下文的相关性来显式判别。通过优化这种判别能力,模型被迫聚焦于目标的独特属性,从而导致更收敛且更高效的推理链。描述性标题还作为可解释性依据,与分段一致。实验在多个基准数据集上表明我们方法的有效性,实现了显著的性能提升,ReasonSeg 的 cIoU 提升 3.09%,推理链长度约降低 42%。代码可在 https://github.com/mrazhou/DPAD 获取。
引用
@article{arxiv.2603.04002,
title = {Discriminative Perception via Anchored Description for Reasoning Segmentation},
author = {Tao Yang and Qing Zhou and Yanliang Li and Qi Wang},
journal= {arXiv preprint arXiv:2603.04002},
year = {2026}
}
备注
Accepted by CVPR 2026