DEF-oriCORN:面向无演示的语言导向操作的高效3D场景理解
机器人学
2024-08-01 v1 人工智能
计算机视觉与模式识别
摘要
我们提出DEF-oriCORN,一个用于语言导向操作任务的框架。通过利用一种新颖的对象基表示和基于扩散模型的状态估计算法,我们的框架能够在没有任何演示的情况下,即使在稀疏摄像头视角和紧密堆叠的环境中,也能高效且稳健地响应语音命令进行操作规划。与传统表示方法不同,我们的表示方法实现了高效的碰撞检测和语言对齐。相对于最先进的基线方法,我们的框架在稀疏RGB图像上实现了卓越的估计和运动规划性能,并能够从零样本方式泛化到真实世界场景,包括透明和反射性物体等多样材料,尽管仅在仿真环境中进行训练。我们的代码用于数据生成、训练、推理以及预训练权重均已公开:https://sites.google.com/view/def-oricorn/home。
关键词
引用
@article{arxiv.2407.21267,
title = {DEF-oriCORN: efficient 3D scene understanding for robust language-directed manipulation without demonstrations},
author = {Dongwon Son and Sanghyeon Son and Jaehyung Kim and Beomjoon Kim},
journal= {arXiv preprint arXiv:2407.21267},
year = {2024}
}