中文

基于常识场景图的目标定位用于物体搜索

机器人学 2024-09-30 v2

摘要

物体搜索是家庭机器人的基本技能,然而核心问题在于机器人准确定位目标物体的能力。家庭环境具有动态特性,表现为用户对日常物品的随意放置,这使得执行目标定位极具挑战性。为了高效定位目标物体,机器人需要具备物体级和房间级的知识。然而,现有方法仅依赖单一类型的知识,导致物体定位性能不佳,进而造成物体搜索过程效率低下。为了解决这一问题,我们提出了一种基于常识场景图的目标定位方法 CSG-TL,以增强家庭环境中的目标物体搜索。给定包含静止物品的预建地图,机器人利用由大型语言模型 (LLM) 生成的物体级常识知识将房间级知识建模为常识场景图 (CSG),为 CSG-TL 提供双重知识支持。为了证明 CSG-TL 在目标定位上的优越性,在真实世界 ScanNet 数据集和 AI2THOR 模拟器上进行了大量实验。此外,我们将 CSG-TL 扩展为物体搜索框架 CSG-OS,并在模拟和真实环境中进行了验证。代码和视频可在 https://sites.google.com/view/csg-os 获取。

关键词

引用

@article{arxiv.2404.00343,
  title  = {Commonsense Scene Graph-based Target Localization for Object Search},
  author = {Wenqi Ge and Chao Tang and Hong Zhang},
  journal= {arXiv preprint arXiv:2404.00343},
  year   = {2024}
}