Uni-LaViRA:面向统一具身导航的语言-视觉-机器人动作翻译
机器人学
2026-05-28 v1 计算机视觉与模式识别
摘要
具身导航需要智能体将语言和视觉观察映射到驱动机器人穿越从未见过的环境的一系列空间动作。主流方法通过不断扩大机器人轨迹集合来扩展视觉-语言-动作(VLA)基础模型。本文认为,针对导航任务,普适性可以从结构上实现,而不仅仅是通过数据规模。导航的底层决策结构归结为单一的语言-视觉-机器人动作翻译。语言动作发出语义级别的方向命令,视觉动作发出像素级别的视觉目标。这两个输出均位于预训练多模态大语言模型(MLLM)的自然输出流形中,因此该任务可以由智能体推理,而非仅通过机器人数据学习。因此,我们提出Uni-LaViRA,一种统一的智能体架构,将相同洞见扩展到四个任务族(VLN-CE、ObjectNav、EQA和Aerial-VLN)以及四种异构真实机器人(轮式机器人、四足机器人、人形机器人和自制无人机),以零样本方式实现。两种智能体循环机制使这种统一成为可能。待办清单记忆(TDM)在每一步重写待办子目标的结构化清单,将未完成的项目复述到智能体最新的注意力窗口中。第二次机会回溯(SCB)将机器人回滚到事前错误状态,并以失败的子轨迹为条件制定下一步计划,将单次导航转化为自我纠错过程。即使没有任何训练工作,Uni-LaViRA在VLN-CE R2R上达到60.7%的成功率,在VLN-CE RxR上达到51.3%,在HM3D-v2上达到77.7%,在HM3D-OVON上达到60.0%,在MP3D-EQA上达到54.7%,在OpenUAV上达到40.0%,与消耗数百万样本和数千小时GPU计算的近期训练导航基础模型相当甚至更好。
引用
@article{arxiv.2605.27582,
title = {Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation},
author = {Hongyu Ding and Sizhuo Zhang and Ziming Xu and Jinwen Guo and Hongxiu Liu and Xingzhi Cheng and Zixuan Chen and Haifei Qi and Duo Wang and Hao Xu and Jieqi Shi and Yifan Zhang and Jing Huo and Jian Cheng and Yang Gao and Jiebo Luo},
journal= {arXiv preprint arXiv:2605.27582},
year = {2026}
}
备注
Project page: https://xetroubadour.github.io/Uni-LaViRA/