中文

PoseGen: 学习使用NeRF生成3D人体姿态数据集

计算机视觉与模式识别 2023-12-25 v1

摘要

本文提出了一个使用 Neural Radiance Fields (NeRF) 生成 3D 人体姿态数据集的端到端框架。由于收集 3D 人体姿态数据需要耗费大量资源,公开数据集在人体姿态和相机视角方面通常缺乏多样性。因此,在公开数据集上训练的姿态估计器在应用于未见的分布外样本时表现显著不佳。先前的工作提出通过生成 2D-3D 姿态对或渲染大量随机数据来扩充公开数据集。这些方法要么忽略了图像渲染,要么导致生成的数据集对预训练模型而言并非最优。在此我们提出 PoseGen,它通过来自给定预训练姿态估计器的反馈损失,学习生成数据集(人体 3D 姿态与图像)。与先前工作相比,我们生成的数据经过优化以提升预训练模型的鲁棒性。PoseGen 的目标是学习一种使给定预训练模型预测误差最大化的数据分布。由于学习到的数据分布包含该预训练模型的 OOD 样本,从该分布中采样数据以进一步微调预训练模型可提升模型的泛化能力。这是首个提出将 NeRF 用于 3D 人体数据生成的工作。NeRF 是数据驱动的,不需要人体的 3D 扫描。因此,使用 NeRF 进行数据生成是便捷的用户特定数据生成的新方向。我们的大量实验表明,所提出的 PoseGen 在四个数据集上改进了两个基线模型(SPIN 和 HybrIK),平均相对提升 6%。

关键词

引用

@article{arxiv.2312.14915,
  title  = {PoseGen: Learning to Generate 3D Human Pose Dataset with NeRF},
  author = {Mohsen Gholami and Rabab Ward and Z. Jane Wang},
  journal= {arXiv preprint arXiv:2312.14915},
  year   = {2023}
}