中文

跑、沉思、调节:面向视觉语言导航的双过程思维系统

人工智能 2025-11-19 v1

摘要

视觉语言导航(VLN)要求智能体遵循人类指令,在复杂三维环境中动态探索。近期研究强调利用大语言模型(LLM)为 VLN 的潜力,鉴于其常识知识与通用推理能力。尽管如此,LLM 基于方法与领域专家之间仍存在显著的任务完成性能差距,因为 LLM 本质上难以精确把握真实世界的空间关联。此外,引入 LLM 伴随显著的计算成本与推理延迟。为此,我们提出一种新型双过程思维框架,称为 R3,将 LLM 的泛化能力与 VLN 特定专业知识以零-shot 方式集成。该框架包含三个核心模块:Runner、Ruminator 与 Regulator。Runner 是基于轻量变换器的专家模型,确保常规情境下的高效精准导航。Ruminator 采用强大的多模态 LLM 作为骨架,采用链式思维(CoT)提示以激发结构化推理。Regulator 监控导航进度,依据三个标准控制合适的思维模式,和谐地集成 Runner 与 Ruminator。实验结果表明,R3 在 REVERIE 基准上在 SPL 与 RGSPL 上分别超过 3.28% 与 3.30%,显著超越其他最先进方法。此显著提升凸显了该方法在处理具有挑战性的 VLN 任务方面的有效性。

关键词

引用

@article{arxiv.2511.14131,
  title  = {Run, Ruminate, and Regulate: A Dual-process Thinking System for Vision-and-Language Navigation},
  author = {Yu Zhong and Zihao Zhang and Rui Zhang and Lingdong Huang and Haihan Gao and Shuo Wang and Da Li and Ruijian Han and Jiaming Guo and Shaohui Peng and Di Huang and Yunji Chen},
  journal= {arXiv preprint arXiv:2511.14131},
  year   = {2025}
}