中文

面向三维人体理解的跨视角与跨姿态补全预训练

计算机视觉与模式识别 2024-04-19 v2

摘要

人体感知与理解是计算机视觉的一个重要领域,与近期许多其他视觉子领域类似,该领域有望从在大型数据集上预训练的大模型中获益。我们假设,依赖以通用、以物体为中心的图像数据集(如 ImageNet)为主的常见预训练策略,受到显著的领域偏移的限制。另一方面,收集特定领域的真值(如 2D 或 3D 标签)难以规模化。因此,我们提出一种基于自监督学习的预训练方法,该方法仅使用图像并在以人为中心的数据上工作。我们的方法使用人体图像对:第一张图像被部分掩码,模型被训练为根据可见部分和第二张图像重建被掩码的部分。它同时依赖立体(跨视角)对以及从视频中取出的时序(跨姿态)对,以学习关于 3D 以及人体运动的先验。我们预训练了一个面向身体中心任务的模型和一个面向手部中心任务的模型。借助通用的 transformer 架构,这些模型在以人为中心的广泛下游任务上优于现有的自监督预训练方法,并且在微调用于基于模型和无模型的人体网格恢复时取得了最先进的性能。

关键词

引用

@article{arxiv.2311.09104,
  title  = {Cross-view and Cross-pose Completion for 3D Human Understanding},
  author = {Matthieu Armando and Salma Galaaoui and Fabien Baradel and Thomas Lucas and Vincent Leroy and Romain Brégier and Philippe Weinzaepfel and Grégory Rogez},
  journal= {arXiv preprint arXiv:2311.09104},
  year   = {2024}
}

备注

CVPR 2024