Flat'n'Fold:面向服装感知与操作的多模态大规模数据集
机器人学
2024-09-30 v1 人工智能
计算机视觉与模式识别
摘要
我们提出Flat'n'Fold,一个用于服装操作的新型大规模数据集,旨在解决现有数据集存在的关键空白。该数据集包含1,212次人类演示和887次机器人演示,涵盖44种不同衣物的8类折叠任务。Flat'n'Fold在规模、范围和多样性方面均超越了以往数据集。我们的数据集独特地捕获了从皱卷到折叠的完整操作过程,提供了同步的多视角RGB-D图像、点云和动作数据,包括手或夹爪的位置和姿态。我们量化了该数据集的多样性和复杂度与现有基准的比较,并表明该数据集在视觉和动作信息方面具有自然且多样的真实世界演示。为展示Flat'n'Fold的实用性,我们为抓取点预测和子任务分解建立了新基准。我们对最新模型在这些任务上的评估显示,在这些任务上仍存在显著的提升空间。这凸显了Flat'n'Fold驱动机器人感知和可变形物体操作的潜力。该数据集可在https://cvas-ug.github.io/flat-n-fold 下载。
引用
@article{arxiv.2409.18297,
title = {Flat'n'Fold: A Diverse Multi-Modal Dataset for Garment Perception and Manipulation},
author = {Lipeng Zhuang and Shiyu Fan and Yingdong Ru and Florent Audonnet and Paul Henderson and Gerardo Aragon-Camarasa},
journal= {arXiv preprint arXiv:2409.18297},
year = {2024}
}