基于域条件场景图的状态导向任务规划
机器人学
2025-09-03 v2
摘要
最近的机器人任务规划框架集成了大型多模态模型(LMM)如 GPT-4o。为解决此类模型存在的定位问题,一种可行方案是将管道划分为感知层状态定位与后续基于状态的规划。本文表明,LMM 方法在粒粒度、结构化、领域特定的场景理解方面仍存在局限。为此,我们发展了更结构化的状态定位框架,其场景表示形式为域条件场景图(domain-conditioned scene graph)。我们表明,该表示形式具有可操作性,因为它可直接映射到诸如规划域定义语言(PDDL)等符号规划语言中的状态。我们提供了该状态定位框架的一个实例,其中域条件场景图的生成采用轻量级视觉语言方法,基于领域相关目标检测对领域特定谓词进行分类。在三个领域上的评估表明,我们的方法在状态定位准确率和任务规划成功率方面显著高于 LMM 方法。
引用
@article{arxiv.2504.06661,
title = {Domain-Conditioned Scene Graphs for State-Grounded Task Planning},
author = {Jonas Herzog and Jiangpin Liu and Yue Wang},
journal= {arXiv preprint arXiv:2504.06661},
year = {2025}
}
备注
Accepted for IROS 2025