面向视觉-语言导航的不确定性感知高斯地图
计算机视觉与模式识别
2026-05-27 v1
摘要
视觉-语言导航(VLN)要求智能体根据自然语言指令在3D环境中导航。在导航过程中,现有智能体通常会遇到感知不确定性,例如缺乏足够证据进行可靠定位或空间线索解释模糊,但它们在预测动作时通常忽略此类信息。在这项工作中,我们显式建模了三种形式的感知不确定性(即几何、语义和外观不确定性),并将其整合到智能体的观测空间中,以实现知情决策。具体而言,我们的智能体首先构建一个语义高斯地图(SGM),该地图由从全景观测初始化的可微3D高斯基元组成,编码了环境的几何结构和语义内容。在SGM之上,通过高斯位置和尺度的变分扰动来估计几何不确定性,以评估结构可靠性;通过扰动高斯语义属性来捕捉语义不确定性,以揭示模糊解释;通过Fisher信息来刻画外观不确定性,该信息衡量渲染观测对高斯级变化的敏感性。这些不确定性被纳入SGM,将其扩展为一个统一的3D价值地图,该地图将这些不确定性作为支持可靠导航的可供性和约束进行基础化。在多个VLN基准上的全面评估显示了我们的智能体的有效性。
引用
@article{arxiv.2605.26503,
title = {Uncertainty-Aware Gaussian Map for Vision-Language Navigation},
author = {Jianzhe Gao and Rui Liu and Yuxuan Xu and Tongtong Cao and Yingxue Zhang and Zhanguang Zhang and Sida Peng and Yi Yang and Wenguan Wang},
journal= {arXiv preprint arXiv:2605.26503},
year = {2026}
}