基于基座模型重写观察-指令以增强视觉语言导航
计算机视觉与模式识别
2025-11-05 v3 人工智能
计算与语言
机器人学
摘要
数据稀缺是视觉语言导航 (VLN) 领域长期面临的挑战,严重限制了代理对未见环境的泛化能力。以往的工作主要依赖额外的模拟数据或网络收集的图像/视频来提高泛化能力。然而,模拟环境仍受限于多样性,网络收集的数据通常需要大量人工以去除噪声。本文提出了一种基于重写的 AugMentation (RAM) 范式,用于 VLN,直接通过重写人工标注的训练数据来创建未见的观察-指令对。凭借我们的重写机制,可在无模拟器且节省人力的条件下获得新的观察-指令对,从而促进泛化。具体而言,我们首先引入对象丰富的观察重写,其中结合视觉语言模型 (VLM) 和大型语言模型 (LLM) 以派生被重写的对象丰富场景描述,实现通过文本到图像生成模型 (T2IM) 合成具有多样化对象和空间布局的观察。随后,我们提出观察对比指令重写,该方法要求 LLM 推理原观察与新观察之间的差异,以生成观察对齐的重写指令。我们进一步开发了一种随机观察裁剪方案的 mixing-then-focusing 训练策略,有效提升数据分布的多样性,同时抑制训练期间的增强数据噪声。在离散环境 (R2R、REVERIE 和 R4R 数据集) 和连续环境 (R2R-CE 数据集) 上的实验表明,我们的方法在性能和强大的泛化能力方面具有优势。代码可在 https://github.com/SaDil13/VLN-RAM 获取。
引用
@article{arxiv.2503.18065,
title = {Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation},
author = {Ziming Wei and Bingqian Lin and Yunshuang Nie and Jiaqi Chen and Shikui Ma and Hang Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2503.18065},
year = {2025}
}
备注
Accepted by IEEE Transactions on Neural Networks and Learning Systems