YOPO-Nav:基于单次通过视频的3DGS图视觉导航
机器人学
2025-12-11 v1 计算机视觉与模式识别
摘要
视觉导航已成为传统机器人导航流程的实用替代方案,后者依赖详细的建图和路径规划。然而,构建和维护三维地图通常计算代价高昂且内存密集。我们解决了在大型环境探索视频可用时的视觉导航问题。这些视频作为视觉参考,使机器人能够在不依赖度量地图的情况下重放已探索的轨迹。我们提出的方法 YOPO-Nav(You Only Pass Once)将环境编码为由互连的局部三维高斯溅射(3DGS)模型组成的紧凑空间表示。在导航过程中,该框架将机器人的当前视觉观测与该表示对齐,并预测引导其返回已演示轨迹的动作。YOPO-Nav 采用分层设计:视觉地点识别(VPR)模块提供粗粒度定位,而局部 3DGS 模型细化目标和中间姿态以生成控制动作。为评估我们的方法,我们引入了 YOPO-Campus 数据集,包含 4 小时的第一人称视频和机器人控制器输入,来自超过 6 公里的人类遥控机器人轨迹。我们在 YOPO-Campus 轨迹上对近期视觉导航方法进行了基准测试,使用 Clearpath Jackal 机器人。实验结果表明,YOPO-Nav 在物理机器人上对真实场景的图像目标导航提供了优异的性能。数据集和代码将对视觉导航和场景表示研究公开发布。
引用
@article{arxiv.2512.09903,
title = {YOPO-Nav: Visual Navigation using 3DGS Graphs from One-Pass Videos},
author = {Ryan Meegan and Adam D'Souza and Bryan Bo Cao and Shubham Jain and Kristin Dana},
journal= {arXiv preprint arXiv:2512.09903},
year = {2025}
}