中文

基于BEV感知与大语言模型的导航指令生成

计算机视觉与模式识别 2024-07-23 v1

摘要

导航指令生成要求具身智能体描述导航路线,这在机器人与人机交互领域引起了极大兴趣。现有研究直接将二维视角观测序列映射到路线描述。尽管直观,但它们忽略了三维环境的几何信息和物体语义。为了解决这些挑战,我们提出了BEVInstructor,它将鸟瞰图特征融入多模态大语言模型以生成指令。具体来说,BEVInstructor构建了一个PerspectiveBEVVisual Encoder,通过融合鸟瞰图和视角特征来理解三维环境。为了利用多模态大语言模型强大的语言能力,融合后的表示被用作多模态大语言模型的视觉提示,并提出了视角-鸟瞰图提示调优以实现参数高效的更新。基于视角-鸟瞰图提示,BEVInstructor进一步采用实例引导的迭代精炼流程,以渐进方式改进指令。BEVInstructor在多个数据集(即R2R、REVERIE和UrbanWalk)上取得了令人印象深刻的性能。

关键词

引用

@article{arxiv.2407.15087,
  title  = {Navigation Instruction Generation with BEV Perception and Large Language Models},
  author = {Sheng Fan and Rui Liu and Wenguan Wang and Yi Yang},
  journal= {arXiv preprint arXiv:2407.15087},
  year   = {2024}
}

备注

ECCV 2024; Project Page: https://github.com/FanScy/BEVInstructor