中文

VoxAct-B:基于体素的双手操作与稳定策略

机器人学 2024-10-08 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

双手操作是许多机器人应用的关键。与单手操作相比,双手操作任务具有更高的动作空间维度。以往的工作依赖大量数据和原始动作来解决此问题,但可能存在样本效率低和在各种任务上受限的泛化问题。为此,我们提出 VoxAct-B,这是一种语言条件化、基于体素的方法,利用视觉语言模型(VLM)优先识别场景中的关键区域并重建体素网格。我们将该体素网格提供给双手操作策略,以学习操作和稳定动作。该方法实现了从体素中更高效的策略学习,并可针对不同任务进行泛化。在仿真中,我们展示了 VoxAct-B 在精细化双手操作任务上超越强大基线。此外,我们在实际的 Open Drawer\texttt{Open Drawer}Open Jar\texttt{Open Jar} 任务中使用两个 UR5 机械臂演示了 VoxAct-B。代码、数据和视频均可在 https://voxact-b.github.io 获取。

关键词

引用

@article{arxiv.2407.04152,
  title  = {VoxAct-B: Voxel-Based Acting and Stabilizing Policy for Bimanual Manipulation},
  author = {I-Chun Arthur Liu and Sicheng He and Daniel Seita and Gaurav Sukhatme},
  journal= {arXiv preprint arXiv:2407.04152},
  year   = {2024}
}

备注

Accepted to the Conference on Robot Learning (CoRL) 2024