中文

g3D-LF:用于具身任务的通用3D语言特征场

计算机视觉与模式识别 2024-11-27 v1 人工智能 机器人学

摘要

我们提出通用3D语言特征场 (g3D-LF),这是一种在大规模3D语言数据集上预训练的3D表示模型,用于具身任务。我们的g3D-LF处理来自智能体的姿态RGB-D图像,对特征场进行编码,以实现:1) 从3D场景中任意位置的新视图表示预测;2) 以智能体为中心生成BEV地图;3) 使用上述表示中的多粒度语言查询目标。我们的表示可以推广到未见过的环境,实现实时构建和动态更新。通过沿采样射线的卷积渲染潜在特征,并通过多尺度编码器整合语义和空间关系,g3D-LF在不同尺度和视角上产生表示,与多粒度语言对齐,通过多级对比学习。此外,我们准备了一个大规模3D语言数据集,以对齐特征场的表示与语言。在 Panorama 和 Monocular 设置下的视觉语言导航、零样本目标导航以及具身问答任务中的大量实验结果突出了g3D-LF在具身任务中显著的优势和有效性。

关键词

引用

@article{arxiv.2411.17030,
  title  = {g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks},
  author = {Zihan Wang and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2411.17030},
  year   = {2024}
}