从左脑到右脑的交叉:面向视觉与语言导航的自适应文本想象器
计算机视觉与模式识别
2025-06-24 v2 人工智能
计算与语言
机器人学
摘要
视觉与语言导航 (VLN) 要求智能体在部分可观测条件下遵循自然指令进行导航,这使得感知与语言的对齐变得困难。近期方法通过想象未来场景来缓解这一问题,然而它们依赖基于视觉的合成,导致计算成本高且细节冗余。为此,我们提出以\textit{语言}形式自适应地想象关键环境语义,从而实现更可靠、更高效的策略。具体而言,我们引入了一种新颖的自适应文本想象器 (Adaptive Text Dreamer, ATD),这是一种基于大型语言模型 (LLM) 构建的双分支自引导想象策略。ATD 采用了类人的左右脑架构,左脑专注于逻辑整合,右脑负责对未来场景的想象预测。为实现这一点,我们仅微调两个大脑中的 Q-former,以高效激活 LLM 中的领域特定知识,从而在导航过程中实现逻辑推理与想象的动态更新。此外,我们引入了交叉交互机制来正则化想象输出并将其注入导航专家模块,使 ATD 能够同时利用 LLM 的推理能力和导航模型的专业知识。我们在 R2R 基准上进行了大量实验,ATD 以更少的参数实现了最先进的性能。代码在\href{https://github.com/zhangpingrui/Adaptive-Text-Dreamer}{此处}。
引用
@article{arxiv.2505.20897,
title = {Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation},
author = {Pingrui Zhang and Yifei Su and Pengyuan Wu and Dong An and Li Zhang and Zhigang Wang and Dong Wang and Yan Ding and Bin Zhao and Xuelong Li},
journal= {arXiv preprint arXiv:2505.20897},
year = {2025}
}