中文

VISTAv2:面向室内视觉语言导航的世界想象

机器人学 2025-12-02 v1 计算机视觉与模式识别

摘要

视觉语言导航 (VLN) 需要智能体在连续的真实世界空间中遵循语言指令行动。先前基于图像想象的 VLN 工作在离散全景图方面显示出优势,但缺乏在线且动作条件化的预测,且不产生显式规划值;此外,许多方法用长期目标取代规划器,这些目标脆弱且效率低下。为弥合这一差距,我们提出了 VISTAv2—a 一个生成式世界模型,通过对过去观察、候选动作序列和指令进行条件化,滚动预测以滚出以观察为导向的未来视图,并将其投射到在线价值图中用于规划。不同于先前方法,VISTAv2 不取代规划器。该在线价值图与基本目标在评分层面融合,提供可达性和风险感知的指导。具体而言,我们采用面向动作的条件扩散变换器视频预测器合成短期未来,借助视觉语言评分器将其与自然语言指令对齐,并融合多个滚动预测以输出想象的以观察为导向的价值图。为提高效率,滚动发生在 VAE 潜在空间中,采用蒸馏采样器和稀疏解码,使其能够在单个消费级 GPU 上进行推理。在 MP3D 和 RoboTHOR 上进行评估,VISTAv2 超过强大的基线,消融实验表明,动作条件化想象、指令引导的价值融合以及在线价值图规划器都是至关重要的,这表明 VISTAv2 为实现稳健的 VLN 提供了实用且可解释的路径。

关键词

引用

@article{arxiv.2512.00041,
  title  = {VISTAv2: World Imagination for Indoor Vision-and-Language Navigation},
  author = {Yanjia Huang and Xianshun Jiang and Xiangbo Gao and Mingyang Wu and Zhengzhong Tu},
  journal= {arXiv preprint arXiv:2512.00041},
  year   = {2025}
}

备注

11 pages, 5 figures