MUVLA:通过地图理解学习探索目标导航
机器人学
2025-10-01 v1
摘要
在本文中,我们提出了 MUVLA,一种专为目标导航定制的地图理解视觉-语言-动作模型。它利用语义地图抽象来统一和结构化历史信息,以紧凑且一致的形式编码空间上下文。MUVLA 将当前和历史观测以及语义地图作为输入,并根据目标物体的描述预测动作序列。此外,它通过基于密集短周期进度信号的奖励引导回报建模来增强监督,使模型能够对奖励最大化的动作价值建立详细理解。MUVLA 采用三阶段训练流程:学习地图级空间理解、从混合质量演示中模仿行为以及奖励放大。该策略允许 MUVLA 将不同的演示统一为鲁棒的空间表示,并生成更合理的探索策略。在 HM3D 和 Gibson 基准上的实验表明,MUVLA 实现了出色的泛化能力,甚至能从低质量或部分成功的轨迹中学习有效的探索行为。
引用
@article{arxiv.2509.25966,
title = {MUVLA: Learning to Explore Object Navigation via Map Understanding},
author = {Peilong Han and Fan Jia and Min Zhang and Yutao Qiu and Hongyao Tang and Yan Zheng and Tiancai Wang and Jianye Hao},
journal= {arXiv preprint arXiv:2509.25966},
year = {2025}
}