PanoGen++: 用于视觉-语言导航的数据驱动全景环境生成
计算机视觉与模式识别
2025-03-14 v1 多媒体
机器人学
摘要
视觉-语言导航(VLN)任务要求智能体依据自然语言指令在三维环境中导航,具有广阔的应用前景。然而,训练数据的稀缺制约了该领域的进步。本文引入 PanoGen++,一种新型框架,旨在通过生成多样且相关的全景环境来缓解这一限制。PanoGen++ 将预训练扩散模型与特定领域的微调相结合,采用参数高效技术(如低秩适配)以降低计算成本。我们研究了两种环境生成方式:掩码图像插帧和递归图像外描。前者通过基于文本描述对掩码区域进行插帧来最大化新环境的生成;后者促进智能体学习全景内的空间关系。在 room-to-room(R2R)、room-for-room(R4R)以及合作视觉-对话导航(CVDN)数据集上进行的实证评估显示:在 R2R 测试排行榜上成功率提升 2.44%,在 R4R 验证未见集合上提升 0.63%,在 CVDN 验证未见集合上的目标进度提升 0.75 米。PanoGen++ 增强了训练环境的多样性和相关性,显著提升了 VLN 任务的泛化能力和整体效果。
引用
@article{arxiv.2503.09938,
title = {PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation},
author = {Sen Wang and Dongliang Zhou and Liang Xie and Chao Xu and Ye Yan and Erwei Yin},
journal= {arXiv preprint arXiv:2503.09938},
year = {2025}
}
备注
This paper was accepted by Neural Networks