Dynam3D:动态分层 3D 标记赋能 VLM 以进行视觉语言导航
计算机视觉与模式识别
2025-05-19 v1 机器人学
摘要
视觉语言导航 (VLN) 是一种核心任务,利用具象化智能体在 3D 环境中依据自然语言指令导航至指定目的地。最近,具备强大泛化能力和丰富常识知识的视频语言大模型 (Video-VLMs) 在 VLN 任务中显示出卓越性能。然而,这些模型在应用于实际 3D 导航时仍面临以下挑战:1)对 3D 几何和空间语义理解不足;2)大规模探索和长期环境记忆能力有限;3)难以适应动态变化的环境。为此,我们提出 Dynam3D,一种动态分层 3D 表示模型,利用语言对齐、通用且分层的 3D 表示作为视觉输入,以训练 3D-VLM 进行导航动作预测。给定带姿态的 RGB-D 图像,我们的 Dynam3D 将 2D CLIP 特征投影到 3D 空间中,并构建多层次 3D 块-实例-区域表示,以动态和分层的方式进行 3D 几何和语义理解。我们的 Dynam3D 能够在线对 3D 实例进行编码和定位,并在变化的环境中动态更新它们,以为导航提供大规模探索和长期记忆能力。通过利用大规模 3D-语言预训练和任务特定的适应,our Dynam3D 在 R2R-CE、REVERIE-CE 和 NavRAG-CE 等 VLN 数据集上取得新的最先进 (SOTA) 性能(仅使用单目设置)。此外,针对预探索、终身记忆和实际机器人实验,验证了实际部署的有效性。
引用
@article{arxiv.2505.11383,
title = {Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation},
author = {Zihan Wang and Seungjun Lee and Gim Hee Lee},
journal= {arXiv preprint arXiv:2505.11383},
year = {2025}
}