WorldMAP:基于生成式世界模型的视觉语言导航轨迹预测
人工智能
2026-04-10 v1 计算机视觉与模式识别
机器人学
摘要
视觉语言模型 (VLM) 和生成式世界模型正在为具身导航开辟出新机遇。VLM 越来越多地被用作直接规划者或轨迹预测器,而世界模型则通过想象未来视角来支持前瞻推理。然而,从单次偶然观察中预测可靠轨迹仍然具有挑战性。当前的 VLM 常常生成不稳定的轨迹,而世界模型虽然能够合成合理的未来,但并不直接提供导航学习所需的扎实信号。这引出一个核心问题:如何将生成的未来转化为扎实的轨迹预测监督信号?我们提出 WorldMAP,这是一个由世界模型驱动的教师-学生框架,将世界模型生成的未来转换为持久的语义-空间结构和基于规划的监督信号。其世界模型驱动的教师从生成的视频中构建语义-空间记忆,锚定任务相关目标和障碍物,并通过显式规划生成轨迹伪标签。随后,一个轻量级学生模型配备多假设轨迹头,直接从视觉语言输入预测导航轨迹。在 Target-Bench 上,WorldMAP 在比较方法中实现了最佳的平均位于 (ADE) 和最终位于 (FDE) 指标,相较于最佳竞争基线,ADE 降低 18.0%,FDE 降低 42.1%,同时将小型开源 VLM 的性能提升至与专有模型相当的水平。更广泛地说,结果表明在具身导航中,世界模型的价值可能更多地体现在为导航学习合成结构化监督方面,而非直接提供可供行动的想象证据。
引用
@article{arxiv.2604.07957,
title = {WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models},
author = {Hongjin Chen and Shangyun Jiang and Tonghua Su and Chen Gao and Xinlei Chen and Yong Li and Zhibo Chen},
journal= {arXiv preprint arXiv:2604.07957},
year = {2026}
}