VinT-6D:来自视觉、触觉与关节信息的大规模手持物体数据集
机器人学
2025-01-07 v2
摘要
本文解决了大规模数据集的稀缺问题,这些数据集对于准确的手持物体姿态估计至关重要,这对于机器人手中操作在“感知-规划-控制”范式中至关重要。具体而言,我们引入VinT-6D,首个集成视觉、触觉与关节信息的大规模多模态数据集,以增强机器人操作。VinT-6D包含200万VinT-Sim和10万VinT-Real数据子集,分别通过MuJoCo和Blender中的仿真以及定制的真实世界平台收集。该数据集针对机器人手,提供整手触觉感知和高质量、良好对齐的数据。据我们所知,VinT-Real是考虑到在真实环境中收集难度最大的数据集,从而可以与以往工作相比,弥合了仿真到真实的差距。基于VinT-6D,我们提出了一种基准方法,显著提高了性能,通过融合多模态信息。该项目可在https://VinT-6D.github.io/上获取。
引用
@article{arxiv.2501.00510,
title = {VinT-6D: A Large-Scale Object-in-hand Dataset from Vision, Touch and Proprioception},
author = {Zhaoliang Wan and Yonggen Ling and Senlin Yi and Lu Qi and Wangwei Lee and Minglei Lu and Sicheng Yang and Xiao Teng and Peng Lu and Xu Yang and Ming-Hsuan Yang and Hui Cheng},
journal= {arXiv preprint arXiv:2501.00510},
year = {2025}
}