中文

VLN-Trans:面向视觉与语言导航智能体的翻译器

计算与语言 2023-02-21 v1

摘要

语言理解对于导航智能体遵循指令至关重要。我们观察到指令中存在两类可能使导航任务变得困难的问题:1. 由于指令发出者与被建模智能体视觉能力的不同,所提及的地标对导航智能体而言不可识别。2. 所提及的地标适用于多个目标,因此在候选视点中选择目标时不具区分性。为解决这些问题,我们为导航智能体设计了一个翻译器模块,用于在每一步将原始指令转换为易于遵循的子指令表示。该翻译器需要基于智能体的视觉能力和观察到的视觉环境,聚焦于可识别且具区分性的地标。为实现这一目标,我们创建了一个新的合成子指令数据集,并设计了特定任务来训练翻译器和导航智能体。我们在 Room2Room (R2R)、Room4room (R4R) 和 Room2Room Last (R2R-Last) 数据集上评估了我们的方法,并在多个基准上取得了最先进的结果。

关键词

引用

@article{arxiv.2302.09230,
  title  = {VLN-Trans: Translator for the Vision and Language Navigation Agent},
  author = {Yue Zhang and Parisa Kordjamshidi},
  journal= {arXiv preprint arXiv:2302.09230},
  year   = {2023}
}