中文

PeopleSansPeople:面向以人为中心的计算机视觉的合成数据生成器

计算机视觉与模式识别 2022-07-13 v2 人工智能 数据库 图形学 机器学习

摘要

近年来,人体检测与人姿估计取得重大进展,得益于大规模标注数据集。然而,这些数据集未对人类活动、姿态或语境多样性提供保证或分析。此外,隐私、法律、安全与伦理问题可能限制采集更多人类数据的能力。缓解上述部分问题的真实世界数据新兴替代方案是合成数据。然而,合成数据生成器的创建极具挑战,阻碍了研究者探索其效用。因此,我们发布以人为中心的合成数据生成器 PeopleSansPeople,其包含仿真就绪的 3D 人体资产、参数化光照与相机系统,并生成 2D 与 3D 边界框、实例与语义分割,以及 COCO 姿态标签。利用 PeopleSansPeople,我们使用 Detectron2 Keypoint R-CNN 变体 [1] 进行了基准合成数据训练。我们发现,使用合成数据预训练网络并在不同规模的真实世界数据上微调,在少样本迁移(COCO-person train [2] 的有限子集)中关键点 AP 提升 +38.03+38.0344.43±0.1744.43 \pm 0.17 对比 6.406.40),在充足真实数据情形下提升 +1.47+1.4763.47±0.1963.47 \pm 0.19 对比 62.0062.00),优于仅用相同真实数据训练的模型。我们还发现,我们的模型优于以 ImageNet 预训练的模型:少样本迁移中关键点 AP 提升 +22.53+22.5344.43±0.1744.43 \pm 0.17 对比 21.9021.90),充足真实数据情形下提升 +1.07+1.0763.47±0.1963.47 \pm 0.19 对比 62.4062.40)。这一免费可用的数据生成器应能在以人为中心的计算机视觉这一关键领域中,推动对仿真到真实迁移学习这一新兴方向的广泛研究。

关键词

引用

@article{arxiv.2112.09290,
  title  = {PeopleSansPeople: A Synthetic Data Generator for Human-Centric Computer Vision},
  author = {Salehe Erfanian Ebadi and You-Cyuan Jhang and Alex Zook and Saurav Dhakad and Adam Crespi and Pete Parisi and Steven Borkman and Jonathan Hogins and Sujoy Ganguly},
  journal= {arXiv preprint arXiv:2112.09290},
  year   = {2022}
}

备注

PeopleSansPeople template Unity environment, benchmark binaries, and source code is available at: https://github.com/Unity-Technologies/PeopleSansPeople