AstraNav-World:用于预见控制与一致性的世界模型
计算机视觉与模式识别
2026-04-09 v2
摘要
在开放且动态的环境中,具象化导航需要准确地预见世界如何演变以及动作如何随时间展开。我们提出 AstraNav-World,一种在统一概率框架内联合推理未来视觉状态和动作序列的 end-to-end 世界模型。我们的框架将基于扩散的视频生成器与视觉语言策略集成,实现同步的 rollout,其中预测场景和计划动作同步更新。训练优化两个互补目标:生成动作条件的多步视觉预测,以及以这些预测的视觉为条件生成轨迹。这一双向约束使视觉预测可执行,保持决策基于物理上一致、与任务相关的未来,缓解了常见于解耦式 envision-then-plan 流水线中的累积误差。跨 diverse embodied navigation benchmarks 的实验显示,轨迹准确性得到改善,成功率提升。消融实验确认紧密的视觉-动作耦合和统一训练的必要性,任一分支移除都会降低预测质量和策略可靠性。在实际世界测试中,AstraNav-World 展现了卓越的 zero-shot 能力,能够在无需任何实际世界微调的情况下适应以前未见过的情景。这些结果表明,AstraNav-World 捕获的是可迁移的空间理解和规划相关的导航动力学,而非仅仅过拟合到仿真特定数据分布。总体而言,通过将预见视觉和控制在单个生成模型中统一,我们更接近可靠、可解释且通用性强的具象化智能体,这些智能体在开放式现实世界环境中运行稳健。
引用
@article{arxiv.2512.21714,
title = {AstraNav-World: World Model for Foresight Control and Consistency},
author = {Jintao Chen and Junjun Hu and Haochen Bai and Minghua Luo and Xinda Xue and Botao Ren and Chengyu Bai and Shichao Xie and Ziyi Chen and Fei Liu and Zedong Chu and Xiaolong Wu and Mu Xu and Shanghang Zhang},
journal= {arXiv preprint arXiv:2512.21714},
year = {2026}
}