中文

InstruGen:基于大型多模态模型的视觉与语言导航指令自动生成

机器人学 2024-11-19 v1

摘要

近期关于视觉与语言导航(VLN)的研究表明,由于缺乏真实的训练环境和高品质的路径-指令对,智能体在未知环境中泛化能力较差。现有构建真实导航场景的方法大多成本高昂,且指令的扩展主要依赖于预定义的模板或规则,缺乏适应性。为了缓解这一问题,我们提出了 InstruGen,一种 VLN 路径-指令对生成范式。具体来说,我们使用 YouTube 房屋参观视频作为真实的导航场景,并利用大型多模态模型(LMMs)强大的视觉理解和生成能力,自动生成多样化且高品质的 VLN 路径-指令对。我们的方法能够生成不同粒度的导航指令,并实现指令与视觉观察之间的细粒度对齐,这是以往方法难以做到的。此外,我们设计了一个多阶段验证机制,以减少 LMMs 的幻觉和不一致性。实验结果表明,使用 InstruGen 生成的路径-指令对训练的智能体在 R2R 和 RxR 基准测试上达到了最先进的性能,尤其是在真实环境中。代码可在 https://github.com/yanyu0526/InstruGen 获取。

关键词

引用

@article{arxiv.2411.11394,
  title  = {InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models},
  author = {Yu Yan and Rongtao Xu and Jiazhao Zhang and Peiyang Li and Xiaodan Liang and Jianqin Yin},
  journal= {arXiv preprint arXiv:2411.11394},
  year   = {2024}
}