中文

RAE-NWM:密集视觉表示空间中的导航世界模型

计算机视觉与模式识别 2026-03-11 v1 机器人学

摘要

视觉导航要求智能体通过感知与规划在复杂环境中到达目标。世界模型通过模拟动作条件状态转换来预测未来观察。当前的导航世界模型通常在变分自编码器压缩潜在空间中学习状态演化,在这种空间中,空间压缩常会丢弃细粒度结构信息,阻碍精确控制。为更好地理解不同表示的传播特性,我们进行了线性动力学探针,观察到密集的DINOv2特征在动作条件转换上表现出更强的线性可预测性。鼓舞我们提出基于表示的自编码器导航世界模型(RAE-NWM),在密集视觉表示空间中建模导航动力学。我们采用带有解耦扩散Transformer头部(CDiT-DH)的条件扩散Transformer来建模连续转换,引入独立的时间驱动门控模块以调节生成期间的动作注入强度。广泛的评估表明,在该空间中建模顺序滚动显著提高了结构稳定性和动作精度,促进了下游规划与导航。

关键词

引用

@article{arxiv.2603.09241,
  title  = {RAE-NWM: Navigation World Model in Dense Visual Representation Space},
  author = {Mingkun Zhang and Wangtian Shen and Fan Zhang and Haijian Qin and Zihao Pei and Ziyang Meng},
  journal= {arXiv preprint arXiv:2603.09241},
  year   = {2026}
}

备注

Code is available at: https://github.com/20robo/raenwm