中文

面向基础模型时代的视觉-语言导航:综述

计算与语言 2024-12-31 v2 计算机视觉与模式识别

摘要

视觉-语言导航 (VLN) 在近年来受到日益关注,涌现出许多方法来推动其发展。基础模型的卓越成就塑造了 VLN 研究的挑战和所提方法。本综述提供了一种自上而下的综述,采用原则化框架进行具身规划与推理,并强调当前方法及未来机会如何利用基础模型来解决 VLN 挑战。我们希望深入讨论能为该领域提供宝贵资源和见解:一方面,兴奋地掩映进展并探索基础模型在该领域的机会和潜在角色;另一方面,将 VLN 中的不同挑战和解决方案组织化,以便为基础模型研究者所理解。

关键词

引用

@article{arxiv.2407.07035,
  title  = {Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models},
  author = {Yue Zhang and Ziqiao Ma and Jialu Li and Yanyuan Qiao and Zun Wang and Joyce Chai and Qi Wu and Mohit Bansal and Parisa Kordjamshidi},
  journal= {arXiv preprint arXiv:2407.07035},
  year   = {2024}
}

备注

Authors contributed equally to this work, and supervisors contributed equal advising to this work; GitHub repository: https://github.com/zhangyuejoslin/VLN-Survey-with-Foundation-Models