CLASH:面向持续视觉语言导航的协作大模型-小模型层次框架
机器人学
2026-01-26 v2
摘要
视觉语言导航(VLN)要求机器人遵循自然语言指令在无先验地图的复杂环境中导航。虽然最近的视觉语言大模型显示出强大的推理能力,但往往在VLN任务中表现不佳,尤其是相对于专用全景小模型。为此,我们提出CLASH(Collaborative Large-Small Hierarchy),即一种VLN-CE框架,集成了反应性小模型规划器(RSMP)与反思性大模型推理器(RLMR)。RSMP采用基于因果学习的双分支架构以提升泛化能力,RLMR利用全景视觉提示结合链式思维推理,以支持可解释的空间理解与导航。我们进一步引入不确定性感知的协作机制(UCM),以适性地融合两者的决策。对于障碍物规避,在仿真环境中,我们将基于规则的控制器替换为可学习的点目标策略,在实际部署中,我们设计了基于LiDAR的聚类模块用于生成可导航的路径点,并配合基于在线SLAM的局部控制器。CLASH在VLN-CE排行榜上取得最先进(SoTA)成绩(位列第一),在test-unseen集合上显著提升了SR和SPL指标,超越了以往的SoTA方法。实际实验表明,CLASH在仿真与部署场景中均表现出强大的鲁棒性,验证了其在实际应用中的有效性。
引用
@article{arxiv.2512.10360,
title = {CLASH: Collaborative Large-Small Hierarchical Framework for Continuous Vision-and-Language Navigation},
author = {Liuyi Wang and Zongtao He and Jinlong Li and Ruihao Xia and Mengxian Hu and Chenpeng Yao and Chengju Liu and Yang Tang and Qijun Chen},
journal= {arXiv preprint arXiv:2512.10360},
year = {2026}
}