面向精准手姿估计的转换等变潜在空间学习
计算机视觉与模式识别
2025-02-19 v1
摘要
基于视觉的回归任务,如手姿估计,已通过表示学习实现了更高的精度和更快的收敛速度。然而,现有的表示学习方法常常面临以下问题:从图像中提取的特征的语义层次过高,难以回归低层次信息;提取的特征包含与任务无关的信息,导致其紧凑性下降,干扰回归任务。为解决这些挑战,我们提出了 TI-Net,这是一个高度通用的视觉网络主干架构,用于构建转换等变潜在空间。具体而言,我们采用线性变换来建模潜在空间中的几何变换,并确保其与图像空间中的变换对齐。这确保了潜在特征能够捕获有利于姿态估计任务的紧凑、低层次信息。我们在手姿估计任务上评估了 TI-Net,以展示该网络的优越性。在 DexYCB 数据集上,TI-Net 相较于专用的状态最佳(SOTA)手姿估计方法实现了 10% 的 PA-MPJPE 指标提升。我们的代码将在未来公开。
引用
@article{arxiv.2502.12535,
title = {Learning Transformation-Isomorphic Latent Space for Accurate Hand Pose Estimation},
author = {Kaiwen Ren and Lei Hu and Zhiheng Zhang and Yongjing Ye and Shihong Xia},
journal= {arXiv preprint arXiv:2502.12535},
year = {2025}
}