中文

RoomTour3D:面向具象化导航的几何感知视频-指令调优

计算机视觉与模式识别 2025-03-20 v2 人工智能 机器人学

摘要

视觉-语言导航(VLN)的训练数据规模和多样性受限,主要受限于现有模拟器的手动精选。为此,我们引入 RoomTour3D,这是一个源自基于网页的客厅之旅视频而生成的视频-指令数据集,这些视频捕捉了真实世界室内空间和人类步行演示。与现有 VLN 数据集不同,RoomTour3D 利用在线视频的规模和多样性来生成开放式的人类步行轨迹和开放世界可导航指令。为了弥补在线视频中缺乏导航数据的不足,我们进行 3D 重建并获取步行路径的 3D 轨迹,增添了关于房间类型、物体位置和周围场景 3D 形状的额外信息。我们的数据集包括约10万条包含开放描述的轨迹,约20万条指令,以及来自1847个客厅之旅环境的约17万条带操作信息的轨迹。我们在多个 VLN 任务上进行了实验,包括 CVDN、SOON、R2R 和 REVERIE,显著改进了这些任务的性能。此外,RoomTour3D 促进了可训练的零样本 VLN 代理的开发,展示了向开放世界导航迈进的潜力与挑战。

关键词

引用

@article{arxiv.2412.08591,
  title  = {RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation},
  author = {Mingfei Han and Liang Ma and Kamila Zhumakhanova and Ekaterina Radionova and Jingyi Zhang and Xiaojun Chang and Xiaodan Liang and Ivan Laptev},
  journal= {arXiv preprint arXiv:2412.08591},
  year   = {2025}
}

备注

CVPR2025