面向通用场景的视觉语言导航适应
计算机视觉与模式识别
2025-01-30 v1 人工智能
计算与语言
摘要
视觉语言导航 (VLN) 任务主要基于单个指令在多个环境中的一次性执行来评估智能体,旨在开发能够以零样本方式在任意环境中工作的智能体。然而,现实中的导航机器人通常在物理布局、视觉观察和来自指示员的语言风格相对稳定的持续性环境中运行。这种任务设置之间的差距为通过融合对特定环境的持续适应来提高 VLN 智能体性能提供了机会。为更贴近现实场景,本文引入 GSA-VLN,这是一个要求智能体在特定场景内执行导航指令的同时进行适应性学习,以实现性能随时间提升的新任务。为评估该任务,需解决现有 VLN 数据集中的两个挑战:缺乏异常分布 (OOD) 数据,以及每个场景指令数量和风格多样性有限。因此,我们提出了新的基准数据集 GSA-R2R,显著扩充了 R2R 数据集中环境和指令的多样性与数量,以评估智能体在 ID 和 OOD 语境下的适应性。此外,我们设计了三阶段指令编排管道,利用大语言模型 (LLM) 优化说话者生成的指令,并通过角色扮演技术将指令改写为不同的说话风格。这一设计基于观察到每个用户在指令中常有一致的签名或偏好。我们在 GSA-R2R 上开展了大量实验,全面评估了数据集和各种方法。基于我们的发现,我们提出了一种新方法 GR-DUET,通过融合基于记忆的导航图谱和环境特定的训练策略,实现了在 GSA-R2R 所有数据划分上的最先进结果。
引用
@article{arxiv.2501.17403,
title = {General Scene Adaptation for Vision-and-Language Navigation},
author = {Haodong Hong and Yanyuan Qiao and Sen Wang and Jiajun Liu and Qi Wu},
journal= {arXiv preprint arXiv:2501.17403},
year = {2025}
}
备注
ICLR 2025