中文

重新思考自监督视觉表示学习在三维人体姿态与形状估计预训练中的作用

计算机视觉与模式识别 2023-03-10 v1

摘要

最近,一些自监督表示学习(SSL)方法在目标检测等视觉任务上超越了 ImageNet 分类预训练。然而,其对三维人体姿态与形状估计(3DHPSE)的影响尚存疑问,该任务目标固定为唯一的类别——人体,且与 SSL 存在固有的任务鸿沟。我们通过实证研究和分析了 SSL 的效果,并进一步将其与其他用于 3DHPSE 的预训练替代方案进行比较。这些替代方案是基于 2D 标注的预训练和合成数据预训练,它们与 SSL 有着减少标注成本的相同动机。它们已被广泛用作弱监督或微调的来源,但尚未被视为预训练来源。SSL 方法在多个 3DHPSE 基准上平均比传统 ImageNet 分类预训练低 7.7%。相比之下,尽管预训练数据量少得多,基于 2D 标注的预训练在所有基准上提高了精度,并在微调期间展现出更快的收敛。我们的观察挑战了当前 SSL 预训练在 3DHPSE 上的朴素应用,并重新彰显了其他数据类型在预训练方面的价值。

关键词

引用

@article{arxiv.2303.05370,
  title  = {Rethinking Self-Supervised Visual Representation Learning in Pre-training for 3D Human Pose and Shape Estimation},
  author = {Hongsuk Choi and Hyeongjin Nam and Taeryung Lee and Gyeongsik Moon and Kyoung Mu Lee},
  journal= {arXiv preprint arXiv:2303.05370},
  year   = {2023}
}

备注

Accepted to ICLR 2023, 18 pages including the appendix