SG-Nav:基于LLM的零样例目标导航中的在线3D场景图提示
计算机视觉与模式识别
2024-10-11 v1 机器人学
摘要
本文提出了一种新的零样例目标导航框架。现有零样例目标导航方法仅以空间上相邻的对象文本作为LLM提示,缺乏足够的场景上下文以进行深入推理。为更好地保留环境信息并充分利用LLM的推理能力,我们提出以3D场景图表示观察到的场景。场景图以LLM友好的结构编码对象、组和房间之间的关系,为此我们设计了分层链式思维提示,以帮助LLM根据场景上下文遍历节点和边来推理目标位置。此外,由于场景图表示,进一步设计了感知误差校正机制,使对象导航框架具备纠正感知误差的能力。我们在MP3D、HM3D和RoboTHOR环境中进行了大量实验,SG-Nav在所有基准测试中均以超过10%的SR优势超越了以前的SOTA零样例方法,而决策过程具有可解释性。在我们所知最早的零样例方法中,SG-Nav在具有挑战性的MP3D基准测试中实现了甚至高于监督式目标导航方法的性能。
引用
@article{arxiv.2410.08189,
title = {SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation},
author = {Hang Yin and Xiuwei Xu and Zhenyu Wu and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2410.08189},
year = {2024}
}
备注
Accepted to NeurIPS 2024. Project page: https://bagh2178.github.io/SG-Nav/