中文

MapDream:面向视觉语言导航的任务驱动地图学习

机器人学 2026-02-04 v2 人工智能 计算机视觉与模式识别

摘要

视觉语言导航(VLN)要求智能体在部分观察的 3D 环境中遵循自然语言指令,这激励了聚合局部感知之外的空间上下文的地图表示。然而,大多数现有方法依赖于独立于导航策略构建的手工地图。我们认为,地图应是由导航目标塑造的学习表示,而非详尽的重建。基于这一洞察,我们提出了 MapDream,一种嵌入式地图框架,将地图构建建模为自回归鸟瞰图(BEV)图像合成。该框架联合学习地图生成和动作预测,将环境上下文浓缩为仅保留导航关键可达性的紧凑三通道 BEV 地图。监督式预训练引导可靠的映射到控制接口,而自回归设计使通过强化学习微调实现端到端联合优化。在 R2R-CE 和 RxR-CE 上的实验实现了最高的单目性能,验证了任务驱动的生成式地图学习。

关键词

引用

@article{arxiv.2602.00222,
  title  = {MapDream: Task-Driven Map Learning for Vision-Language Navigation},
  author = {Guoxin Lian and Shuo Wang and Yucheng Wang and Yongcai Wang and Maiyue Chen and Kaihui Wang and Bo Zhang and Zhizhong Su and Deying Li and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2602.00222},
  year   = {2026}
}