中文

通过生成未来视图图像语义改进视觉与语言导航

计算机视觉与模式识别 2023-04-12 v1 人工智能 计算与语言 机器学习

摘要

视觉与语言导航(VLN)是要求智能体依据自然语言指令在环境中导航的任务。每一步,智能体从一组可导航位置中选择下一动作。本文中,我们旨在更进一步,探究智能体是否能从生成潜在未来视图中获益。直观上,人类会基于自然语言指令与周围视图对未来环境外观产生预期,从而辅助正确导航。因此,为赋予智能体生成未来导航视图语义的能力,我们首先在智能体的域内预训练中提出三个代理任务:掩码全景建模(MPM)、掩码轨迹建模(MTM)与基于图像生成的动作预测(APIG)。这三个目标分别教导模型预测全景中缺失视图(MPM)、预测完整轨迹中缺失步骤(MTM),以及基于完整指令与导航历史生成下一视图(APIG)。随后,我们以最小化智能体生成视图语义与下一步真实视图语义间差异的辅助损失在VLN任务上微调智能体。实证上,我们的VLN-SIG在Room-to-Room数据集与CVDN数据集上均达到新的最先进水平。我们进一步定性展示智能体学会填补未来视图中缺失块,这为智能体预测动作带来更强可解释性。最后,我们证明学习预测未来视图语义还使智能体在更长路径上具备更优性能。

关键词

引用

@article{arxiv.2304.04907,
  title  = {Improving Vision-and-Language Navigation by Generating Future-View Image Semantics},
  author = {Jialu Li and Mohit Bansal},
  journal= {arXiv preprint arXiv:2304.04907},
  year   = {2023}
}

备注

CVPR 2023 (Project webpage: https://jialuli-luka.github.io/VLN-SIG)