VoxAct-B:基于体素的双手操作与稳定策略
机器人学
2024-10-08 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
双手操作是许多机器人应用的关键。与单手操作相比,双手操作任务具有更高的动作空间维度。以往的工作依赖大量数据和原始动作来解决此问题,但可能存在样本效率低和在各种任务上受限的泛化问题。为此,我们提出 VoxAct-B,这是一种语言条件化、基于体素的方法,利用视觉语言模型(VLM)优先识别场景中的关键区域并重建体素网格。我们将该体素网格提供给双手操作策略,以学习操作和稳定动作。该方法实现了从体素中更高效的策略学习,并可针对不同任务进行泛化。在仿真中,我们展示了 VoxAct-B 在精细化双手操作任务上超越强大基线。此外,我们在实际的 和 任务中使用两个 UR5 机械臂演示了 VoxAct-B。代码、数据和视频均可在 https://voxact-b.github.io 获取。
引用
@article{arxiv.2407.04152,
title = {VoxAct-B: Voxel-Based Acting and Stabilizing Policy for Bimanual Manipulation},
author = {I-Chun Arthur Liu and Sicheng He and Daniel Seita and Gaurav Sukhatme},
journal= {arXiv preprint arXiv:2407.04152},
year = {2024}
}
备注
Accepted to the Conference on Robot Learning (CoRL) 2024