中文

MVHumanNet:一个大规模多视角日常着装人体捕捉数据集

计算机视觉与模式识别 2023-12-06 v1

摘要

在这个时代,大语言模型和文本到图像模型的成功可归因于大规模数据集的驱动力。然而,在3D视觉领域,尽管使用大规模合成和真实捕获的物体数据(如Objaverse和MVImgNet)训练的模型取得了显著进展,但在以人为中心的任务领域尚未观察到类似水平的进展,部分原因是缺乏大规模的人体数据集。由于获取大规模高质量3D人体数据面临巨大挑战,现有的高保真3D人体捕捉数据集仍为中等规模。为了弥补这一差距,我们提出了MVHumanNet,这是一个包含4,500个人体身份的多视角人体动作序列数据集。我们工作的主要重点是使用一个易于扩展数据采集的多视角人体捕捉系统,收集具有大量多样化身份和日常服装的人体数据。我们的数据集包含9,000套日常服装、60,000个动作序列和6.45亿帧图像,并带有广泛的标注,包括人体掩膜、相机参数、2D和3D关键点、SMPL/SMPLX参数以及相应的文本描述。为了探索MVHumanNet在各种2D和3D视觉任务中的潜力,我们对视角一致性动作识别、人体NeRF重建、文本驱动的无约束视角人体图像生成,以及2D无约束视角人体图像和3D化身生成进行了初步研究。大量实验证明了MVHumanNet所提供的规模带来的性能提升和有效应用。作为当前最大规模的3D人体数据集,我们希望MVHumanNet数据及其标注的发布将促进大规模3D以人为中心任务领域的进一步创新。

关键词

引用

@article{arxiv.2312.02963,
  title  = {MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human Captures},
  author = {Zhangyang Xiong and Chenghong Li and Kenkun Liu and Hongjie Liao and Jianqiao Hu and Junyi Zhu and Shuliang Ning and Lingteng Qiu and Chongjie Wang and Shijie Wang and Shuguang Cui and Xiaoguang Han},
  journal= {arXiv preprint arXiv:2312.02963},
  year   = {2023}
}

备注

Project page: https://x-zhangyang.github.io/MVHumanNet/