稀疏视频生成推动现实世界超视野视觉语言导航
计算机视觉与模式识别
2026-02-06 v1 机器人学
摘要
为何必须依赖详尽冗长的语言指令进行视觉语言导航?虽然这些细节有助于决策,但它们根本与现实世界导航的目标相矛盾。理想情况下,智能体应仅凭简单高层意图,在未知环境中自主导航。实现这一目标带来了巨大挑战:超视野导航(BVN),即智能体必须在没有密集且逐步引导的情况下定位远方、不可见的目标。现有基于大语言模型(LLM)的方法虽擅长遵循密集指令,却因依赖短视角监督而常出现目标导向行为。仅扩展监督视野会 destabilize LLM 训练。本文指出,视频生成模型天然受益于长程监督以与语言指令对齐,因而特别适用于BVN任务。我们首次将视频生成模型引入该领域。然而,生成数十秒视频的延迟极高,难以实现实际部署。为弥合这一鸿沟,我们提出SparseVideoNav,通过生成稀疏的未来视频(覆盖20秒时域)实现亚秒级轨迹推理,较未优化版本提升了27倍。大量零样本实验表明,SparseVideoNav在BVN任务上的成功率是最先进LLM基线的2.5倍,并首次在具有挑战性的夜间场景中实现此能力。
引用
@article{arxiv.2602.05827,
title = {Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation},
author = {Hai Zhang and Siqi Liang and Li Chen and Yuxian Li and Yukuan Xu and Yichao Zhong and Fu Zhang and Hongyang Li},
journal= {arXiv preprint arXiv:2602.05827},
year = {2026}
}