中文

PanoGen++: 用于视觉-语言导航的数据驱动全景环境生成

计算机视觉与模式识别 2025-03-14 v1 多媒体 机器人学

摘要

视觉-语言导航(VLN)任务要求智能体依据自然语言指令在三维环境中导航,具有广阔的应用前景。然而,训练数据的稀缺制约了该领域的进步。本文引入 PanoGen++,一种新型框架,旨在通过生成多样且相关的全景环境来缓解这一限制。PanoGen++ 将预训练扩散模型与特定领域的微调相结合,采用参数高效技术(如低秩适配)以降低计算成本。我们研究了两种环境生成方式:掩码图像插帧和递归图像外描。前者通过基于文本描述对掩码区域进行插帧来最大化新环境的生成;后者促进智能体学习全景内的空间关系。在 room-to-room(R2R)、room-for-room(R4R)以及合作视觉-对话导航(CVDN)数据集上进行的实证评估显示:在 R2R 测试排行榜上成功率提升 2.44%,在 R4R 验证未见集合上提升 0.63%,在 CVDN 验证未见集合上的目标进度提升 0.75 米。PanoGen++ 增强了训练环境的多样性和相关性,显著提升了 VLN 任务的泛化能力和整体效果。

关键词

引用

@article{arxiv.2503.09938,
  title  = {PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation},
  author = {Sen Wang and Dongliang Zhou and Liang Xie and Chao Xu and Ye Yan and Erwei Yin},
  journal= {arXiv preprint arXiv:2503.09938},
  year   = {2025}
}

备注

This paper was accepted by Neural Networks