中文

X作为监督:应对无监督单目3D姿态估计中的深度模糊

计算机视觉与模式识别 2024-11-21 v1

摘要

近期无监督单目3D姿态估计方法致力于减少对有限标注3D数据的依赖,但多数方法仅在2D空间中构建,忽视了固有的深度模糊问题。由于3D到2D投影的信息损失,可能存在多个潜在深度,但其中只有部分在人体结构中是合理的。为解决深度模糊,我们提出了一种新颖的无监督框架,包含多假设检测器和多个定制的预文本任务。检测器从局部窗口内的热图中提取多个假设,有效处理多解问题。此外,预文本任务利用SMPL模型中的3D人体先验来正则化姿态估计的解空间,使其与3D人体结构的经验分布对齐。这种正则化部分通过判别学习中的基于GCN的判别器实现,并通过渲染合成图像进一步补充,从而确保合理的估计。因此,我们的方法在多种人体数据集上实现了最先进的无监督3D姿态估计性能。在数据规模扩展和一个动物数据集上的进一步评估凸显了其泛化能力。代码将在https://github.com/Charrrrrlie/X-as-Supervision提供。

关键词

引用

@article{arxiv.2411.13026,
  title  = {X as Supervision: Contending with Depth Ambiguity in Unsupervised Monocular 3D Pose Estimation},
  author = {Yuchen Yang and Xuanyi Liu and Xing Gao and Zhihang Zhong and Xiao Sun},
  journal= {arXiv preprint arXiv:2411.13026},
  year   = {2024}
}