中文

面向视觉与语言导航的掩码路径建模

计算机视觉与模式识别 2023-05-24 v1 计算与语言

摘要

视觉与语言导航(VLN)智能体通过遵循自然语言指令被训练以在真实世界环境中导航。VLN 中的一个主要挑战是训练数据的有限可用性,这阻碍了模型的有效泛化能力。先前的方法试图通过在训练期间引入额外监督来解决此问题,通常这需要昂贵的人工标注数据,从而限制了可扩展性。在本文中,我们引入了一种掩码路径建模(MPM)目标,其使用智能体自收集的数据为下游导航任务进行预训练。我们提出的方法让智能体在无特定目标的情况下主动探索导航环境并收集其所经过的路径。随后,我们在这些收集的数据上训练智能体,以在给定随机掩码子路径的情况下重建原始路径。以此方式,智能体可以在学习条件动作生成的同时主动积累多样且大量的数据。为评估我们技术的有效性,我们在多个 VLN 数据集上进行了实验,并展示了 MPM 在不同指令复杂度水平上的通用性。我们的结果在成功率上表现出显著提升,在 Room-to-Room、Room-for-Room 和 Room-across-Room 数据集的 val-unseen 划分上分别提升了 1.32%、1.05% 和 1.19%。此外,我们进行了分析,突出了当允许智能体在测试前探索未见环境时进一步改进的潜力。

关键词

引用

@article{arxiv.2305.14268,
  title  = {Masked Path Modeling for Vision-and-Language Navigation},
  author = {Zi-Yi Dou and Feng Gao and Nanyun Peng},
  journal= {arXiv preprint arXiv:2305.14268},
  year   = {2023}
}