中文

3D Diffuser Actor:具有 3D 场景表示的策略扩散

机器人学 2024-07-26 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

扩散策略是条件扩散模型,学习以机器人和环境状态为条件的机器人动作分布。最近的研究表明,其表现优于确定性方法和其他动作分布学习公式。3D 机器人策略使用从单个或多个相机视图聚合的 3D 场景特征表示,并利用感测深度。研究表明,它们在不同相机视图下的泛化能力优于其 2D 对应物。我们统一了这两条研究路线,提出了 3D Diffuser Actor,这是一种配备新型 3D 去噪变换器的神经策略,该变换器融合来自 3D 视觉场景、语言指令和本体感觉的信息,以预测噪声 3D 机器人姿态轨迹中的噪声。3D Diffuser Actor 在 RLBench 上设立了新的最先进水平 (SOTA),在多视图设置上比当前 SOTA 绝对性能提升 18.1%,在单视图设置上绝对提升 13.1%。在 CALVIN 基准测试上,其相对于当前 SOTA 提升了 9%。它还学会了通过少量演示在现实世界中控制机器人机械臂。通过与当前 SOTA 策略的详尽比较以及对我们模型的消融实验,我们展示了 3D Diffuser Actor 的设计选择在大幅超越 2D 表示、回归和分类目标、绝对注意力机制以及整体非令牌化 3D 场景嵌入方面表现出色。

关键词

引用

@article{arxiv.2402.10885,
  title  = {3D Diffuser Actor: Policy Diffusion with 3D Scene Representations},
  author = {Tsung-Wei Ke and Nikolaos Gkanatsios and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:2402.10885},
  year   = {2024}
}

备注

First two authors contributed equally