中文

Uni-NaVid:基于视频的统一具身导航视觉语言动作模型

机器人学 2025-02-07 v2 计算机视觉与模式识别

摘要

实际的导航代理必须能够处理各种交互需求,例如遵循指令、搜索物体、回答问题、跟踪人员等。现有的具身导航模型在实际世界中无法作为实用通用解,因它们往往受限于特定的任务配置或预定义的具有离散路径的地图。在本工作中,我们提出了 Uni-NaVid,即第一个视频基的视觉语言动作 (VLA) 模型,旨在统一多样化的具身导航任务,实现在未知真实环境中对混合长期任务的无缝导航。Uni-NaVid 通过融合所有常见具身导航任务的输入和输出数据配置,从而将所有任务集成到一个模型中。对于训练 Uni-NaVid,我们总计收集了 360 万个导航数据样本,来自四个基本导航子任务,并通过跨任务学习促进学习协同。广泛的实验在全面的导航基准测试上清晰地展示了 Uni-NaVid 在统一建模方面的优势,并表明其实现了最先进的性能。此外,真实世界的实验确认了该模型的有效性和效率,为其强大的通用性提供了依据。

关键词

引用

@article{arxiv.2412.06224,
  title  = {Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks},
  author = {Jiazhao Zhang and Kunyu Wang and Shaoan Wang and Minghan Li and Haoran Liu and Songlin Wei and Zhongyuan Wang and Zhizheng Zhang and He Wang},
  journal= {arXiv preprint arXiv:2412.06224},
  year   = {2025}
}

备注

Project page: https://pku-epic.github.io/Uni-NaVid/