通过多模态学习演示大规模多吸盘物品抓取:基于抓取成功预测
机器人学
2025-06-13 v1 机器学习
摘要
本工作展示了如何从稀疏标记的真实世界数据中自动学习机器人操作的各个方面,以提供提升性能的解决方案。具体而言,它聚焦于多吸盘机器人抓取,对应用多模态视觉编码器用于预测候选机器人抓取成功性进行了全面研究。从非结构化堆积中抓取多样物品是机器人操作在真实世界环境中(如仓库)重要且具有挑战性的任务。从杂乱中抓取的方法必须能够处理开放的物品集合,同时满足时延约束以实现高吞吐量。所示方法利用多种输入模态(如 RGB、深度和语义分割)来估计候选多吸盘抓取的质量。该策略基于真实世界的物品抓取数据进行训练,结合了多模态预训练和微调。手稿提供了在大型物品抓取数据集上的全面实验评估,包括旨在包含部分遮挡的物品抓取数据集,以及针对包装物品(如箱子和信封)的包装数据集。评估测量了不同物品配置、抓取场景和物体类型的性能。消融实验有助于理解域内预训练的影响、不同模态的影响以及微调的重要性。这些消融实验揭示了在多模态上进行训练的重要性,以及模型在预训练期间学习模态之间关系的能力,使得在微调和推理期间,仅使用其中一部分作为输入。
引用
@article{arxiv.2506.10359,
title = {Demonstrating Multi-Suction Item Picking at Scale via Multi-Modal Learning of Pick Success},
author = {Che Wang and Jeroen van Baar and Chaitanya Mitash and Shuai Li and Dylan Randle and Weiyao Wang and Sumedh Sontakke and Kostas E. Bekris and Kapil Katyal},
journal= {arXiv preprint arXiv:2506.10359},
year = {2025}
}
备注
Accepted to Robotics: Science and Systems (RSS 2025), 15 pages