MonoDream:基于全景构想的单目视觉语言导航
计算机视觉与模式识别
2025-12-01 v4 机器人学
摘要
视觉语言导航 (VLN) 任务通常利用全景 RGB 和深度输入为动作规划提供丰富的空间线索,但这些传感器在实际部署中可能昂贵或不可接近。最近基于视觉语言动作 (VLA) 的方法在单目输入下取得了强大的成绩,但仍落后于使用全景 RGB-D 信息的方法。我们提出 MonoDream,一个轻量级 VLA 框架,使单目智能体能够学习统一导航表示 (UNR)。这种共享特征表示同时对齐与导航相关的视觉语义(例如全局布局、深度和未来线索)和语言 grounding 的动作意图,实现更可靠的动作预测。MonoDream 进一步引入潜在全景构想 (LPD) 任务来监督 UNR,该任务在仅使用单目输入的基础上训练模型预测当前和未来步骤中全景 RGB 和深度观察的潜在特征。实验表明,MonoDream 在多个 VLN 基准测试上 consistently 改善了单目导航性能,并显著缩小了与全景式智能体之间的差距。
引用
@article{arxiv.2508.02549,
title = {MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming},
author = {Shuo Wang and Yongcai Wang and Zhaoxin Fan and Yucheng Wang and Maiyue Chen and Kaihui Wang and Zhizhong Su and Wanting Li and Xudong Cai and Yeying Jin and Deying Li},
journal= {arXiv preprint arXiv:2508.02549},
year = {2025}
}