基于BEV感知与大语言模型的导航指令生成
计算机视觉与模式识别
2024-07-23 v1
摘要
导航指令生成要求具身智能体描述导航路线,这在机器人与人机交互领域引起了极大兴趣。现有研究直接将二维视角观测序列映射到路线描述。尽管直观,但它们忽略了三维环境的几何信息和物体语义。为了解决这些挑战,我们提出了BEVInstructor,它将鸟瞰图特征融入多模态大语言模型以生成指令。具体来说,BEVInstructor构建了一个PerspectiveBEVVisual Encoder,通过融合鸟瞰图和视角特征来理解三维环境。为了利用多模态大语言模型强大的语言能力,融合后的表示被用作多模态大语言模型的视觉提示,并提出了视角-鸟瞰图提示调优以实现参数高效的更新。基于视角-鸟瞰图提示,BEVInstructor进一步采用实例引导的迭代精炼流程,以渐进方式改进指令。BEVInstructor在多个数据集(即R2R、REVERIE和UrbanWalk)上取得了令人印象深刻的性能。
引用
@article{arxiv.2407.15087,
title = {Navigation Instruction Generation with BEV Perception and Large Language Models},
author = {Sheng Fan and Rui Liu and Wenguan Wang and Yi Yang},
journal= {arXiv preprint arXiv:2407.15087},
year = {2024}
}
备注
ECCV 2024; Project Page: https://github.com/FanScy/BEVInstructor