3DCoMPaT$^{++}$:用于组合识别的改进大规模三维视觉数据集
计算机视觉与模式识别
2025-04-30 v3 人工智能
摘要
在本工作中,我们提出3DCoMPaT,一个多模态2D/3D数据集,包含超过1000万个在部件实例级别精心标注的风格化3D形状的1.6亿张渲染视图,以及匹配的RGB点云、3D带纹理网格、深度图和分割掩码。3DCoMPaT涵盖41个形状类别、275个细粒度部件类别和293个可组合应用于3D对象部件的细粒度材料类别。我们从四个等间距视角以及四个随机视角渲染了100万个风格化形状的子集,总计产生1.6亿张渲染图。部件在实例级别进行分割,具有粗粒度和细粒度语义层级。我们引入一项称为基于地面的组合识别(GCR)的新任务,以集体识别和定位3D对象部件上材料的组合。此外,我们报告了在CVPR2023上组织的数据挑战赛的结果,展示了获胜方法对训练于6D输入的改进PointNet模型的使用,并探索了用于提升GCR的替代技术。我们希望我们的工作有助于简化未来关于组合式3D视觉的研究。
引用
@article{arxiv.2310.18511,
title = {3DCoMPaT$^{++}$: An improved Large-scale 3D Vision Dataset for Compositional Recognition},
author = {Habib Slim and Xiang Li and Yuchen Li and Mahmoud Ahmed and Mohamed Ayman and Ujjwal Upadhyay and Ahmed Abdelreheem and Arpit Prajapati and Suhail Pothigara and Peter Wonka and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2310.18511},
year = {2025}
}
备注
https://3dcompat-dataset.org/v2/