基于训练-free 场景解析的通用 3D 视觉定位方法 UniGround
机器人学
2026-03-10 v1 计算机视觉与模式识别
摘要
从自然语言描述中理解和定位复杂 3D 环境中的对象,称为 3D 视觉定位 (3DVG),是具身人工智能中的一个基础性挑战,对机器人、增强现实和人机交互具有广泛意义。大规模预训练基础模型推动了该领域的显著进展,使开放词汇 3DVG 成为可能,使系统能够在给定场景中定位任意对象。然而,这些方法依赖预训练模型,限制了 3D 感知与推理在已有知识边界内进行,导致对未见 spatial relationship 和对分布外场景的鲁棒性差。本文通过替换受限感知,采用训练-free 的视觉与几何推理,实现超越训练数据范围的开放世界 3DVG,使任何场景中任意对象的定位成为可能。具体而言,提出的 UniGround 包含两个阶段:全局候选过滤阶段通过训练-free 的 3D 拓扑和多视角语义编码构建场景候选;局部精确定位阶段利用多尺度视觉提示和结构化推理精准识别目标对象。在 ScanRefer 和 EmbodiedScan 数据集上实验表明,UniGround 在 ScanRefer 上实现了 46.1%/34.1% [email protected]/0.5,在 EmbodiedScan 上实现了 28.7% [email protected],建立了在 EmbodiedScan 上无 3D 监督情况下零样本方法的新型态。我们进一步评估了 UniGround 在真实环境中的表现,面对不可控重建条件和显著 domain shift,训练-free 推理在精炼数据集之外具有良好鲁棒性。
引用
@article{arxiv.2603.08131,
title = {UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing},
author = {Jiaxi Zhang and Yunheng Wang and Wei Lu and Taowen Wang and Weisheng Xu and Shuning Zhang and Yixiao Feng and Yuetong Fang and Renjing Xu},
journal= {arXiv preprint arXiv:2603.08131},
year = {2026}
}
备注
14 pages,6 figures,3 tables