MapDream:面向视觉语言导航的任务驱动地图学习
机器人学
2026-02-04 v2 人工智能
计算机视觉与模式识别
摘要
视觉语言导航(VLN)要求智能体在部分观察的 3D 环境中遵循自然语言指令,这激励了聚合局部感知之外的空间上下文的地图表示。然而,大多数现有方法依赖于独立于导航策略构建的手工地图。我们认为,地图应是由导航目标塑造的学习表示,而非详尽的重建。基于这一洞察,我们提出了 MapDream,一种嵌入式地图框架,将地图构建建模为自回归鸟瞰图(BEV)图像合成。该框架联合学习地图生成和动作预测,将环境上下文浓缩为仅保留导航关键可达性的紧凑三通道 BEV 地图。监督式预训练引导可靠的映射到控制接口,而自回归设计使通过强化学习微调实现端到端联合优化。在 R2R-CE 和 RxR-CE 上的实验实现了最高的单目性能,验证了任务驱动的生成式地图学习。
引用
@article{arxiv.2602.00222,
title = {MapDream: Task-Driven Map Learning for Vision-Language Navigation},
author = {Guoxin Lian and Shuo Wang and Yucheng Wang and Yongcai Wang and Maiyue Chen and Kaihui Wang and Bo Zhang and Zhizhong Su and Deying Li and Zhaoxin Fan},
journal= {arXiv preprint arXiv:2602.00222},
year = {2026}
}