中文

面向连续环境零样本视觉语言导航的语言-视觉-机器人动作翻译

机器人学 2026-03-05 v2

摘要

LaViRA: 在连续环境中进行零样本视觉语言导航(VLN-CE)要求智能体基于自然语言指令在未见环境中导航,而无需任何先验训练。当前方法面临关键权衡:要么依赖环境特定的路标预测器限制场景泛化,要么在导航期间 underutilize 大模型的推理能力。我们引入LaViRA,一个简单而有效的零样本框架,通过将动作分解为粗到细的层次结构来解决这一困境:语言动作用于高层规划,视觉动作用于中层感知对齐,机器人动作用于低层控制。这种模块化分解使我们能够在每个阶段利用不同规模的多模态大语言模型(MLLM)的独特优势,构建一个在推理、对齐和实际控制方面都具有强大能力的系统。LaViRA在VLN-CE基准测试中显著优于现有领先方法,展示了在未见环境中具备卓越泛化能力,同时保持面向实际部署的透明性和效率。项目页面:https://robo-lavira.github.io/lavira-zs-vln/

关键词

引用

@article{arxiv.2510.19655,
  title  = {LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments},
  author = {Hongyu Ding and Ziming Xu and Yudong Fang and You Wu and Zixuan Chen and Jieqi Shi and Jing Huo and Yifan Zhang and Yang Gao},
  journal= {arXiv preprint arXiv:2510.19655},
  year   = {2026}
}

备注

ICRA 2026