中文

DEF-oriCORN:面向无演示的语言导向操作的高效3D场景理解

机器人学 2024-08-01 v1 人工智能 计算机视觉与模式识别

摘要

我们提出DEF-oriCORN,一个用于语言导向操作任务的框架。通过利用一种新颖的对象基表示和基于扩散模型的状态估计算法,我们的框架能够在没有任何演示的情况下,即使在稀疏摄像头视角和紧密堆叠的环境中,也能高效且稳健地响应语音命令进行操作规划。与传统表示方法不同,我们的表示方法实现了高效的碰撞检测和语言对齐。相对于最先进的基线方法,我们的框架在稀疏RGB图像上实现了卓越的估计和运动规划性能,并能够从零样本方式泛化到真实世界场景,包括透明和反射性物体等多样材料,尽管仅在仿真环境中进行训练。我们的代码用于数据生成、训练、推理以及预训练权重均已公开:https://sites.google.com/view/def-oricorn/home。

关键词

引用

@article{arxiv.2407.21267,
  title  = {DEF-oriCORN: efficient 3D scene understanding for robust language-directed manipulation without demonstrations},
  author = {Dongwon Son and Sanghyeon Son and Jaehyung Kim and Beomjoon Kim},
  journal= {arXiv preprint arXiv:2407.21267},
  year   = {2024}
}