SceneFunRI:面向任务驱动功能性目标定位的不可见区域推理
计算机视觉与模式识别
2026-05-15 v1 人工智能
机器人学
摘要
在真实场景中,目标物体可能位于不可见的区域。虽然人类通常能根据上下文和常识推断被遮挡物体的位置,但这种能力对视觉语言模型 (VLMs) 仍是一项重大挑战。为弥补这一差距,我们引入了 SceneFunRI,一个用于不可见区域推理的基准。基于 SceneFun3D 数据集,SceneFunRI 通过半自动流水线将该任务表述为二维空间推理问题,并包含 855 个实例。它要求模型根据任务指令和常识推理推断不可见功能性物体的位置。最强的基线模型 (Gemini 3 Flash) 仅达到 15.20 的 CAcc@75、0.74 的 mIoU 和 28.65 的 Dist。我们将提示分析分为三类:强指令提示、基于推理的提示和空间排除法。这些发现表明,不可见区域推理在当前 VLMs 中仍是一种不稳定的能力,这促使未来开展更紧密整合任务意图、常识先验、空间定位与不确定性感知搜索的模型研究。
引用
@article{arxiv.2605.14704,
title = {SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization},
author = {Posheng Chen and Powen Cheng and Gueter Josmy Faure and Hung-Ting Su and Winston H. Hsu},
journal= {arXiv preprint arXiv:2605.14704},
year = {2026}
}