分割模型能理解世界吗?迈向基于视觉思维链的主动可供性推理
计算机视觉与模式识别
2026-05-28 v1 人工智能
摘要
最近的分割模型将大语言模型与掩码解码器耦合,以将复杂的语言表达落地为掩码,然而它们的指令仍然是目标指涉性的:它们描述、约束或暗示待分割的区域。然而,在现实世界的具身交互中,人类指令通常是意图层面的,这包括期望的结果,而不指明实现该结果所需的区域。为弥合这一差距,我们引入了SegWorld,其中模型在确定掩码之前,通过多级视觉思维链对场景进行推理。在接收任何指令之前,它主动观察场景,描述可见物体并推断它们可能支持的可能事件。给定一个指令后,它继续推理链:从与意图相关的物体,到满足意图的动作,再到物理交互部位,即提供该动作可供性的物体部件。我们将SegWorld形式化为概率推理,其中主动观察提供了语言场景上下文,当指令在意图层面给出时,该上下文能改善掩码预测。我们构建了一个意图到部件基准,用于评估从高层目标出发的可供性承载部件分割。实验表明,SegWorld在目标指涉性指令上匹配了指令驱动基线,并在意图层面指令上取得了显著提升。
引用
@article{arxiv.2605.27764,
title = {Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought},
author = {Yuchen Guo and Junli Gong and Hongmin Cai and Yiu-ming Cheung and Weifeng Su},
journal= {arXiv preprint arXiv:2605.27764},
year = {2026}
}