NaVIDA: 基于逆向动力学增强的视觉语言导航
计算机视觉与模式识别
2026-03-17 v2 人工智能
摘要
视觉语言导航要求智能体在视觉丰富的环境中解释自然语言指令并作出连贯的动作。然而,现有大多数方法依赖反应式状态-动作映射,缺乏显式以动作为基础的视觉动力学建模。由于缺乏对动作如何改变后续视觉观测的认知,智能体无法合理规划动作,导致行为不稳定、泛化能力弱以及轨迹上的累积误差。为解决这些问题,我们引入了 \textsc{NaVIDA}(\textbf{Nav}igation with \textbf{I}nverse \textbf{D}ynamics \textbf{A}ugmentation,基于逆向动力学增强的导航),这是一个轻量级的视觉语言导航框架,将逆向动力学监督作为显式目标,把以动作为基础的视觉动力学嵌入到策略学习中。通过在共享的表示与动作空间中联合优化该视觉动力学与基于指令条件的动作预测,\textsc{NaVIDA} 提供了额外的结构化监督,对学习进行正则化,从而实现更稳定、更一致的导航。为构建该监督并扩展有效规划范围,\textsc{NaVIDA} 采用了分层概率动作分块,将轨迹组织为多步分块,并提供具有区分度的、更长程的视觉变化线索。大量实验表明,\textsc{NaVIDA} 在参数量更少(3B 对 8B)的情况下,相比 SOTA 方法取得了更优的导航性能。真实世界机器人评估进一步验证了本方法的实际可行性与有效性。
引用
@article{arxiv.2601.18188,
title = {\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation},
author = {Weiye Zhu and Zekai Zhang and Xiangchen Wang and Hewei Pan and Teng Wang and Tiantian Geng and Rongtao Xu and Feng Zheng},
journal= {arXiv preprint arXiv:2601.18188},
year = {2026}
}
备注
27 pages, 11 figures