中文

ST-Booster:面向连续环境下的视觉语言导航的迭代时空感知提升器

计算机视觉与模式识别 2025-12-03 v2 机器人学

摘要

视觉语言导航在连续环境(VLN-CE)要求智能体基于自然语言指令导航至未知的连续空间。与离散设置不同,VLN-CE提出了两个核心感知挑战:其一,缺乏预定义的观察点导致视觉记忆异质且全球空间相关性减弱;其二,三维场景中的累积重建误差引入结构性噪声,损害局部特征感知。为解决这些挑战,本文提出了ST-Booster,一种通过多粒度感知和指令感知推理提升导航性能的迭代时空提升器。ST-Booster包含三个关键模块——层次时空编码(HSTE)、多粒度对齐融合(MGAF)和价值导向航点生成(VGWG)。HSTE利用拓扑图编码长期全局记忆,并通过网格图捕获短期局部细节。MGAF通过几何感知知识融合对这些双图表示进行指令对齐。所得表示经预训练任务迭代细化。在推理期间,VGWG生成引导式注意力热图(GAH)以显式建模环境-指令相关性并优化航点选择。进行了大量比较实验和性能分析,表明ST-Booster在复杂且易受干扰的环境中优于现有状态最佳方法。

关键词

引用

@article{arxiv.2504.09843,
  title  = {ST-Booster: An Iterative SpatioTemporal Perception Booster for Vision-and-Language Navigation in Continuous Environments},
  author = {Lu Yue and Dongliang Zhou and Liang Xie and Erwei Yin and Feitian Zhang},
  journal= {arXiv preprint arXiv:2504.09843},
  year   = {2025}
}

备注

11 pages, 7 figures