FantasyVLN:面向视觉-语言导航的统一多模态链律推理
计算机视觉与模式识别
2026-01-26 v2 机器人学
摘要
在视觉-语言导航(VLN)中实现人类水平性能,要求具身智能体在理解多模态指令和视觉-空间语境的同时,进行长范围动作序列的推理。近期工作如 NavCoT 和 NavGPT-2 表明,链律推理(CoT)在提高可解释性和长程规划方面具有潜力。此外,诸如 OctoNav-R1 和 CoT-VLA 之类的多模态扩展进一步验证了 CoT 作为通向类人导航推理的可行路径。然而,现有方法面临关键缺陷:纯文本 CoT 缺乏空间锚定,容易过拟合于稀疏标注推理步骤;而多模态 CoT 则因生成想象视觉观察而导致 token 膨胀,使实时导航变得不可行。本文提出 FantasyVLN,一个统一的隐式推理框架,保留 CoT 推理的优势而无需显式 token 开销。具体而言,想象中的视觉 token 通过预训练的视觉自归模型(VAR)编码到紧凑的潜在空间中进行 CoT 推理训练,模型在统一的多 CoT 策略下联合学习文本、视觉和多模态 CoT 模式。推理时,该模型执行直接的指令到动作映射,同时仍享有推理感知的表示。广泛的 LH-VLN 实验表明,我们的方法实现了具备推理意识但实时的导航,显著提高了成功率和效率,同时将显式 CoT 方法的推理延迟降低了一个数量级。
引用
@article{arxiv.2601.13976,
title = {FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation},
author = {Jing Zuo and Lingzhou Mu and Fan Jiang and Chengcheng Ma and Mu Xu and Yonggang Qi},
journal= {arXiv preprint arXiv:2601.13976},
year = {2026}
}