基于记忆的定位:面向三维功能可供性的跨场景与场景内记忆
计算机视觉与模式识别
2026-05-13 v1
摘要
功能可供性定位需要的不仅仅是识别物体:智能体必须定位支持特定交互的精确区域,例如要拉动的把手或要按下的按钮。这对于免训练视觉-语言流程而言是困难的,因为可操作区域通常很小、视觉上模糊不清,并且在场景中同一类别的多个实例间重复出现。我们提出了 AFFORDMEM,这是一个通过两个层面记忆几何信息来定位三维功能可供性的框架。第一个层面是跨场景可供性记忆:智能体维护一个类别级别的记忆库,其中包含以叠加方式渲染了可供性区域的 RGB 图像,并在查询时召回信息最丰富的示例,以引导冻结的视觉语言模型(VLM)关注那些纯文本提示始终会遗漏的小型可操作子区域。第二个层面是场景内空间记忆:当智能体处理场景时,它将候选实例及其三维空间关系组织成一个结构化的场景图,使语言模型能够解析对远处或当前未观察到的候选对象的引用,例如“从顶部数第二个把手”。AFFORDMEM 无需模型微调,也无需目标场景标注,它使用一个从源场景构建的可重用记忆库。在 SceneFun3D 数据集上,我们的方法在 Split 0 和 Split 1 上的 AP50 指标分别比先前的免训练最优方法提高了 3.23 和 3.7。消融研究证实了互补优势:跨场景可供性记忆改善了细粒度定位,而场景内空间记忆在空间限定查询上带来了更大的增益。项目主页见项目页面。
引用
@article{arxiv.2605.11616,
title = {Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances},
author = {Qirui Wang and Jingyi He and Yining Pan and Xulei Yang and Shijie Li},
journal= {arXiv preprint arXiv:2605.11616},
year = {2026}
}