中文

通过立体视觉和中层视觉赋能动态城市导航

计算机视觉与模式识别 2025-12-12 v1

摘要

语言和视觉领域基础模型的成功激发了全端到端机器人导航基础模型(NFMs)的研究。NFMs直接将单目视觉输入映射到控制动作,完全忽略了中层视觉模块(跟踪、深度估计等)。虽然视觉能力将隐式涌现的假设很有吸引力,但这需要大量难以获取的像素到动作监督。这一挑战在动态和非结构化环境中尤为突出,因为鲁棒导航需要精确的几何和动态理解,而单目视图中的深度尺度模糊性进一步限制了准确的空间推理。在本文中,我们表明依赖单目视觉并忽略中层视觉先验是低效的。我们提出了StereoWalker,它通过立体输入和显式中层视觉(如深度估计和密集像素跟踪)来增强NFMs。我们的直觉很简单:立体输入解决了深度尺度模糊性,而现代中层视觉模型在动态场景中提供了可靠的几何和运动结构。我们还策划了一个大型立体导航数据集,通过从互联网立体视频自动标注动作来支持StereoWalker的训练并促进未来研究。通过实验,我们发现中层视觉使StereoWalker仅使用1.5%的训练数据就能达到与最先进方法相当的性能,并在使用全部数据时超越最先进方法。我们还观察到立体视觉比单目输入产生更高的导航性能。

关键词

引用

@article{arxiv.2512.10956,
  title  = {Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision},
  author = {Wentao Zhou and Xuweiyi Chen and Vignesh Rajagopal and Jeffrey Chen and Rohan Chandra and Zezhou Cheng},
  journal= {arXiv preprint arXiv:2512.10956},
  year   = {2025}
}

备注

Project Page: https://www.cs.virginia.edu/~tsx4zn/stereowalk/