中文

PanoGen:用于视觉与语言导航的文本条件全景环境生成

计算机视觉与模式识别 2023-05-31 v1 人工智能 计算与语言 机器学习

摘要

视觉与语言导航(VLN)要求智能体遵循语言指令在三维环境中导航。VLN 的一个主要挑战是逼真训练环境的可用性有限,这使得难以泛化到新的和未见过的环境。为解决这个问题,我们提出 PanoGen,一种能够根据文本潜在生成无限多样全景环境的生成方法。具体而言,我们通过为现有 Matterport3D 环境中的房间图像添加描述来收集房间描述,并利用最先进的文本到图像扩散模型生成新的全景环境。我们对生成的图像使用递归外绘(outpainting)来创建一致的 360 度全景视图。我们的新全景环境通过以文本描述为条件与原始环境共享相似的语义信息,这确保了全景中物体的共现符合人类直觉,并通过图像外绘在房间外观和布局上创造足够的多样性。最后,我们探索了在 VLN 预训练和微调中利用 PanoGen 的两种方式。我们使用基于预训练视觉与语言模型构建的说话器(speaker)为 PanoGen 环境中的路径生成指令以用于 VLN 预训练,并在智能体微调期间用我们的全景环境增强视觉观测以避免对所见环境的过拟合。实证上,使用我们的 PanoGen 环境学习在 Room-to-Room、Room-for-Room 和 CVDN 数据集上达到了新的最先进水平(SOTA)。使用我们的 PanoGen 说话器数据进行预训练对 CVDN 尤其有效,该数据集具有欠规范的指令并需要常识知识。最后,我们表明智能体可从更多生成的全景环境训练中受益,这暗示了扩展 PanoGen 环境的有前景的结果。

关键词

引用

@article{arxiv.2305.19195,
  title  = {PanoGen: Text-Conditioned Panoramic Environment Generation for Vision-and-Language Navigation},
  author = {Jialu Li and Mohit Bansal},
  journal= {arXiv preprint arXiv:2305.19195},
  year   = {2023}
}

备注

Project Webpage: https://pano-gen.github.io/