SceneTeract:3D 场景中基于智能体的功能可达性与 VLM grounding
计算机视觉与模式识别
2026-04-01 v1
摘要
具身 AI 依赖支持多样化用户进行有意义活动的交互式 3D 环境,但评估其功能可达性仍是核心挑战。我们引入 SceneTeract,一个在特定智能体约束下验证 3D 场景功能性的框架。我们的核心贡献是将高层语义推理与低层几何检查相结合的 grounding 验证引擎。SceneTeract 将复杂活动分解为原子动作序列,并针对具身智能体配置,验证每一步是否满足可达性、间隙和可导航性等可达性要求,运用显式物理和几何模拟。我们部署 SceneTeract 对 (i) 合成室内环境进行深入评估,发现阻碍基本交互的常见功能性失效;以及 (ii) 前沿视觉语言模型 (VLM) 推理关于和预测功能可达性的能力,揭示即便是当前最强模型也在语义置信度与物理可行性之间存在系统性偏差。最后,我们将 SceneTeract 作为 VLM 后训练的奖励引擎,实现了将几何约束可扩展蒸馊到推理模型中的能力。我们发布了 SceneTeract 验证套件和数据,以桥接感知与物理现实,促进具身 3D 场景理解。
引用
@article{arxiv.2603.29798,
title = {SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes},
author = {Léopold Maillard and Francis Engelmann and Tom Durand and Boxiao Pan and Yang You and Or Litany and Leonidas Guibas and Maks Ovsjanikov},
journal= {arXiv preprint arXiv:2603.29798},
year = {2026}
}
备注
Project page: https://sceneteract.github.io/