中文

FlexVLN:面向多样化视觉语言导航任务的灵活适配

计算机视觉与模式识别 2025-03-19 v1 机器人学

摘要

视觉语言导航(VLN)任务的理想目标是开发具备强大适应性的具身智能体,能够无缝将其导航能力跨越到各种任务中。尽管近年来取得了显著进展,大多数方法仍需数据集特定的训练,缺乏能够泛化到包含不同指令类型的多样数据集的能力。大语言模型(LLM)已显示出卓越的推理和泛化能力,在机器人动作规划中展现出巨大潜力。本文提出FlexVLN,一种创新的层次化VLN方法,将基于监督学习的指令跟随器的基本导航能力与LLM规划器的强大泛化能力相结合,实现对多样VLN数据集的有效泛化。此外,还提出了验证机制和多模型集成机制,以缓解LLM规划器可能产生的幻觉,并提高指令跟随器的执行准确性。我们选取REVERIE、SOON和CVDN-target作为外部域数据集来评估泛化能力。实验结果表明,FlexVLN的泛化性能在所有以往方法中均表现出色。

关键词

引用

@article{arxiv.2503.13966,
  title  = {FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks},
  author = {Siqi Zhang and Yanyuan Qiao and Qunbo Wang and Longteng Guo and Zhihua Wei and Jing Liu},
  journal= {arXiv preprint arXiv:2503.13966},
  year   = {2025}
}