中文

MVHumanNet++:用于3D人类数字化的大规模多视角日常穿着人体捕获数据集

计算机视觉与模式识别 2025-05-06 v1

摘要

在当前时代,大型语言模型和文本到图像模型的成功归功于大规模数据集的推动力。然而,在3D视觉领域,尽管通过类似Objaverse和MVImgNet等大规模数据集在物体中心任务中取得了显著进展,但在人类中心任务方面仅有限的进展,主要由于缺乏类似的大规模人类数据集。为弥合这一差距,我们提出了MVHumanNet++,该数据集包含4500个身份的多视角人体动作序列。我们的工作主要关注收集具有大量不同身份和日常服装的人体数据,这些数据使用多视角人体捕获系统收集,便于可扩展的数据收集。该数据集包含9000套日常服装、60000个动作序列和6.45亿帧,包含广泛的注释,包括人体遮罩、相机参数、2D和3D关键点、SMPL/SMPLX参数以及相应的文本描述。此外,还针对提出的MVHumanNet++数据集添加了新处理的法线图和深度图,显著扩展了其在高级人类中心研究中的适用性和实用性。为了探索MVHumanNet++数据集在各种2D和3D视觉任务中的潜力,我们进行了若干初始研究,以展示由MVHumanNet++提供的规模所 enabled 的性能提升和有效应用。作为当前最大规模的3D人类数据集,我们希望MVHumanNet++数据集的发布能够在规模化的人类中心任务领域进一步推动创新。MVHumanNet++数据集已公开提供,网址为https://kevinlee09.github.io/research/MVHumanNet++/。

关键词

引用

@article{arxiv.2505.01838,
  title  = {MVHumanNet++: A Large-scale Dataset of Multi-view Daily Dressing Human Captures with Richer Annotations for 3D Human Digitization},
  author = {Chenghong Li and Hongjie Liao and Yihao Zhi and Xihe Yang and Zhengwentai Sun and Jiahao Chang and Shuguang Cui and Xiaoguang Han},
  journal= {arXiv preprint arXiv:2505.01838},
  year   = {2025}
}

备注

project page: https://kevinlee09.github.io/research/MVHumanNet++/. arXiv admin note: substantial text overlap with arXiv:2312.02963