中文

TrianguLang:面向无姿态的3D定位的几何感知语义共识

计算机视觉与模式识别 2026-04-21 v3

摘要

从自然语言在3D空间中定位物体和部件是机器人、增强现实和具身人工智能领域的核心任务,但现有方法在每场景优化的精度与几何一致性与前馈推理的效率之间存在权衡。我们提出TrianguLang,一个无需推理阶段相机标定的3D定位前馈框架。不同于先前方法将视图独立处理的方式,我们引入几何感知语义注意(Geometry-Aware Semantic Attention, GASA),利用预测几何信息对跨视图特征对应性进行门控,从而在无需真实姿态的情况下抑制语义上合理但几何上不一致的匹配。在包括ScanNet++和uCO3D在内的五个基准数据集上进行验证,TrianguLang实现了语义共识与3D定位的前沿性能,将用户操作 effort 从 O(N)O(N) 次点击降低至单个文本查询。该模型在无优化情况下的每帧分辨率为1008x1008,处理时间约为57ms(约18 FPS),可实现交互式机器人和AR应用的实际部署。代码与模型权重已公开于 https://cwru-aism.github.io/triangulang/。

关键词

引用

@article{arxiv.2603.08096,
  title  = {TrianguLang: Geometry-Aware Semantic Consensus for Pose-Free 3D Localization},
  author = {Bryce Grant and Aryeh Rothenberg and Atri Banerjee and Peng Wang},
  journal= {arXiv preprint arXiv:2603.08096},
  year   = {2026}
}

备注

Tables updated with current results, typographical errors fixed