中文

Vision-and-Language Navigation 生成式预训练变换器

人工智能 2024-05-28 v1 计算与语言 计算机视觉与模式识别 机器人学

摘要

在视觉语言导航 (VLN) 领域,智能体需要依据语言指令在真实场景中进行导航。使智能体在整个导航过程中遵循指令 represents 这一挑战在VLN领域中尤为突出。为此常见方法往往依赖编码器显式记录过去的位置和动作,从而增加模型的复杂性和资源消耗。我们提出的方案,视觉语言导航生成式预训练变换器 (VLN-GPT),采用生成式预训练变换器 (GPT2) 解码器模型来建模轨迹序列依赖关系,无需历史编码模块。该方法通过轨迹序列实现对历史信息的直接访问,提高了效率。此外,我们将模型的训练过程分为离线基于模仿学习的预训练和在线基于强化学习的微调。这一划分允许更聚焦的训练目标并提升性能。VLN数据集上的性能评估表明,VLN-GPT超过了复杂的基于编码器的前沿模型。

关键词

引用

@article{arxiv.2405.16994,
  title  = {Vision-and-Language Navigation Generative Pretrained Transformer},
  author = {Wen Hanlin},
  journal= {arXiv preprint arXiv:2405.16994},
  year   = {2024}
}