中文

视觉-语言导航:综述与分类

计算机视觉与模式识别 2022-04-05 v3 多媒体

摘要

视觉-语言导航 (VLN) 任务要求智能体遵循人类语言指令在未见过的环境中进行导航。这一涉及自然语言处理、计算机视觉、机器人学等问题的挑战性领域催生了许多专注于各种 VLN 任务的优秀工作。本文根据这些任务中语言指令的不同特征,对这些任务提供了全面的综述和深刻的分类。根据导航指令是一次性给出还是多次给出,本文将任务分为两类,即单轮和多轮任务。对于单轮任务,我们根据指令是指定单一目标位置还是指定多个位置的序列,将其进一步细分为目标导向和路线导向。对于多轮任务,我们根据是否允许智能体对指令提问,将其细分为被动和交互式任务。这些任务要求智能体具备不同的能力,并需要各种模型设计。我们总结了这些任务的进展,并探讨了现有 VLN 模型和任务设置的局限性。最后,我们讨论了 VLN 的几个开放性问题,并指出了未来的一些机遇,即将知识与 VLN 模型相结合并将其应用于真实的物理世界。

关键词

引用

@article{arxiv.2108.11544,
  title  = {Vision-Language Navigation: A Survey and Taxonomy},
  author = {Wansen Wu and Tao Chang and Xinmeng Li},
  journal= {arXiv preprint arXiv:2108.11544},
  year   = {2022}
}