中文

动态拓扑感知:打破视觉语言导航中的粒度刚性

计算机视觉与模式识别 2026-01-30 v1

摘要

连续环境下的视觉语言导航 (VLN-CE) 面临核心挑战:将高层语言指令 grounding 到精确、安全且跨时段的空间动作。显式拓扑地图已被证明是为此类任务提供稳健空间记忆的关键解决方案。然而,现有拓扑规划方法存在“粒度刚性”问题。具体而言,这些方法通常依赖固定的几何阈值来采样节点,无法适应环境复杂度的不同。这种刚性导致严重的匹配失调:模型倾向于在简单区域过采样,造成计算冗余;而在高不确定性区域欠采样,增加碰撞风险并损害精度。为此,我们提出 DGNav(Dynamic Topological Navigation)框架,引入情境感知机制动态调节地图密度和连接性。我们的方案包含两个核心创新:(1) 场景感知自适应策略,基于预测路标点的离散程度动态调节图构建阈值,实现对复杂环境的“按需密化”;(2) 动态图变换器,通过融合视觉、语言和几何线索构建动态边权,实现代理人过滤拓扑噪声,提升指令遵循度。针对 R2R-CE 和 RxR-CE 基准进行的大量实验表明,DGNav 在导航性能和强泛化能力方面均表现优异。此外,消融研究确认本框架在导航效率与安全探索之间实现了最佳权衡。代码已公开于 https://github.com/shannanshouyin/DGNav。

关键词

引用

@article{arxiv.2601.21751,
  title  = {Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation},
  author = {Jiankun Peng and Jianyuan Guo and Ying Xu and Yue Liu and Jiashuang Yan and Xuanwei Ye and Houhua Li and Xiaoming Wang},
  journal= {arXiv preprint arXiv:2601.21751},
  year   = {2026}
}