以基础模型为不确定性估计器的信念空间规划
人工智能
2025-04-07 v1 机器人学
摘要
在开放式环境中进行通用机器人移动操作面临着诸多挑战,包括时段漫长、目标复杂以及部分可见性不足。一个有前景的解决方法是使用一组参数化技能进行规划,通过任务规划器对这些技能进行排序,以实现由结构化语言指定的目标,例如对符号事实的逻辑表达式。虽然可以将视觉语言模型 (VLM) 用于将这些表达式 grounding,但它们通常假设完全可见性,当代理缺乏足够信息以确定事实 certainty 时会导致次优行为。本文引入了一种新框架,利用VLM作为感知模块来估计不确定性并促进符号grounding。我们的 method 构建了符号信念表示,并使用信念空间规划器生成不确定性感知的计划以整合战略信息收集。这使代理能够有效地推理部分可见性和属性不确定性。我们在一系列需要在部分可见性环境中进行推理的具有挑战性的真实任务上展示了该系统。仿真评估表明,我们的方法在规划和执行战略信息收集方面优于基于VLM的端到端规划或基于VLM的状态估计基线。这一工作突显了VLM构建信念空间符号场景表示的潜力,使下游任务(如不确定性感知规划)成为可能。
引用
@article{arxiv.2504.03245,
title = {Seeing is Believing: Belief-Space Planning with Foundation Models as Uncertainty Estimators},
author = {Linfeng Zhao and Willie McClinton and Aidan Curtis and Nishanth Kumar and Tom Silver and Leslie Pack Kaelbling and Lawson L. S. Wong},
journal= {arXiv preprint arXiv:2504.03245},
year = {2025}
}