LLM-Grounder:以大型语言模型为智能体的开放词汇 3D 视觉定位
计算机视觉与模式识别
2023-09-22 v1 人工智能
计算与语言
机器学习
机器人学
摘要
3D 视觉定位是家用机器人的一项关键技能,使其能够根据环境进行导航、操纵物体和回答问题。虽然现有方法通常依赖大量标注数据或在处理复杂语言查询时存在局限,我们提出了 LLM-Grounder,一种新颖的零样本、开放词汇、基于大型语言模型(LLM)的 3D 视觉定位流程。LLM-Grounder 利用 LLM 将复杂自然语言查询分解为语义成分,并采用视觉定位工具(如 OpenScene 或 LERF)来识别 3D 场景中的物体。随后 LLM 评估所提议物体之间的空间和常识关系以做出最终定位决策。我们的方法不需要任何标注训练数据,并可泛化到新颖的 3D 场景和任意文本查询。我们在 ScanRefer 基准上评估 LLM-Grounder,展示了最先进的零样本定位精度。我们的结果表明,LLM 显著提升了定位能力,尤其是针对复杂语言查询,使 LLM-Grounder 成为机器人 3D 视觉-语言任务的有效方法。视频和交互式演示可在项目网站 https://chat-with-nerf.github.io/ 找到。
引用
@article{arxiv.2309.12311,
title = {LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent},
author = {Jianing Yang and Xuweiyi Chen and Shengyi Qian and Nikhil Madaan and Madhavan Iyengar and David F. Fouhey and Joyce Chai},
journal= {arXiv preprint arXiv:2309.12311},
year = {2023}
}
备注
Project website: https://chat-with-nerf.github.io/