利用 2D 掩码重建提升 3D 姿态估计的领域适应
计算机视觉与模式识别
2025-02-26 v2 机器学习
摘要
RGB 基于的 3D 姿态估计方法在深度学习的发展以及高质量 3D 姿态数据集的出现方面取得了成功。然而,大多数现有方法对于测试图像分布与训练数据分布差异较大的情形表现不佳。尽管可以通过引入多样化数据来缓解这一问题,但收集带有对应标签(即 3D 姿态)的多样化数据并非易事。本文提出了一种基于掩码图像建模(MIM)框架的 3D 姿态估计无监督领域适应方法,利用带标签数据和无标签数据。进一步提出了前景中心重建和注意力正则化,以提高无标签数据使用的效果。在人类和手部姿态估计任务上开展了 various 数据集上的实验,尤其涉及跨域场景。我们通过在所有数据集上实现准确率提升至领先水平,证明了本方法的有效性。
引用
@article{arxiv.2501.08408,
title = {Leveraging 2D Masked Reconstruction for Domain Adaptation of 3D Pose Estimation},
author = {Hansoo Park and Chanwoo Kim and Jihyeon Kim and Hoseong Cho and Nhat Nguyen Bao Truong and Taehwan Kim and Seungryul Baek},
journal= {arXiv preprint arXiv:2501.08408},
year = {2025}
}
备注
16 pages, 7 figures