假设图精修:基于假设驱动探索与级联误差修正的具身导航
计算机视觉与模式识别
2026-04-07 v1
摘要
具身智能体必须在部分观测环境中进行探索,同时保持可靠的长期记忆。基于图的现有导航系统提高了可扩展性,但它们通常将未探索区域视为语义未知,导致低效的前沿搜索。虽然视觉语言模型(VLMs)可以预测前沿语义,但错误的预测可能被嵌入记忆并通过下游推理传播,导致结构误差累积,仅靠置信度衰减无法解决。这些观察需要一个能够利用语义预测进行有方向探索同时在新证据反驳时系统性地撤销错误的框架。我们提出了假设图精修(HGR),一个将前沿预测表示为依赖感知图记忆中可修正假设节点的框架。HGR 引入(1)语义假设模块,该模块估计前沿上的上下文条件语义分布,并根据目标相关性、旅行成本和不确定性对探索目标进行排序,以及(2)验证驱动的级联修正,该模块将现场观测与预测语义进行比较,在不匹配时撤销被反驳的节点及其所有下游依赖。与加法式地图构建不同,这允许图通过剪除错误子图来收缩,从而在整个长周期内保持记忆可靠。我们在多模态终身导航(GOAT-Bench)和具身问答(A-EQA、EM-EQA)上评估了 HGR。HGR 在 GOAT-Bench 上实现了 72.41% 的成功率和 56.22% 的 SPL,并在两个 QA 基准上表现出一致的改进。诊断分析显示,级联修正消除了约 20% 的结构冗余假设节点,并将对错误区域的重复访问减少了 4.5 倍,其中镜面反射和透明表面占纠正预测错误的 67%。
引用
@article{arxiv.2604.04108,
title = {Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation},
author = {Peixin Chen and Guoxi Zhang and Jianwei Ma and Qing Li},
journal= {arXiv preprint arXiv:2604.04108},
year = {2026}
}