视觉-语言导航:综述与分类
计算机视觉与模式识别
2022-04-05 v3 多媒体
摘要
视觉-语言导航 (VLN) 任务要求智能体遵循人类语言指令在未见过的环境中进行导航。这一涉及自然语言处理、计算机视觉、机器人学等问题的挑战性领域催生了许多专注于各种 VLN 任务的优秀工作。本文根据这些任务中语言指令的不同特征,对这些任务提供了全面的综述和深刻的分类。根据导航指令是一次性给出还是多次给出,本文将任务分为两类,即单轮和多轮任务。对于单轮任务,我们根据指令是指定单一目标位置还是指定多个位置的序列,将其进一步细分为目标导向和路线导向。对于多轮任务,我们根据是否允许智能体对指令提问,将其细分为被动和交互式任务。这些任务要求智能体具备不同的能力,并需要各种模型设计。我们总结了这些任务的进展,并探讨了现有 VLN 模型和任务设置的局限性。最后,我们讨论了 VLN 的几个开放性问题,并指出了未来的一些机遇,即将知识与 VLN 模型相结合并将其应用于真实的物理世界。
引用
@article{arxiv.2108.11544,
title = {Vision-Language Navigation: A Survey and Taxonomy},
author = {Wansen Wu and Tao Chang and Xinmeng Li},
journal= {arXiv preprint arXiv:2108.11544},
year = {2022}
}