基于大模型的可纠正地标发现:面向视觉语言导航
计算机视觉与模式识别
2024-06-06 v2 人工智能
计算与语言
摘要
视觉语言导航 (VLN) 需要智能体遵循语言指令到达目标位置。成功的关键在于将指令中隐含的地标与多样化的视觉观察对齐。然而,先前的 VLN 智能体因学习数据有限且缺乏足够的开放世界对齐知识,在未探索场景下难以实现精准的模态对齐。本文提出一种新的 VLN 范式,称为可纠正地标发现框架 (CONSOLE)。在 CONSOLE 中,我们将 VLN 建模为开放世界顺序地标发现问题,引入基于两种大模型 ChatGPT 和 CLIP 的 novel correctable landmark discovery scheme。具体而言,我们使用 ChatGPT 提供丰富的开放世界地标共现常识,并基于这些常识进行 CLIP 驱动的地标发现。为缓解由于缺乏视觉约束导致的先验噪声,我们引入可学习的共现评分模块,根据实际观察纠正每个共现的重要性,以实现精准的地标发现。我们进一步设计了观察增强策略,以优雅地将框架与不同的 VLN 智能体集成,利用纠正后的地标特征获取增强的观察特征用于动作决策。广泛的实验结果表明,CONSOLE 在多个流行 VLN 框架(R2R、REVERIE、R4R、RxR)上均显著优于强基准,尤其在未见场景中实现了 R2R 和 R4R 的新型态最佳结果。代码已公开:https://github.com/expectorlin/CONSOLE。
引用
@article{arxiv.2405.18721,
title = {Correctable Landmark Discovery via Large Models for Vision-Language Navigation},
author = {Bingqian Lin and Yunshuang Nie and Ziming Wei and Yi Zhu and Hang Xu and Shikui Ma and Jianzhuang Liu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2405.18721},
year = {2024}
}
备注
Accepted by TPAMI 2024