用于 EgoExo4D 姿态与熟练度估计挑战赛的 PCIE_Pose 解决方案
计算机视觉与模式识别
2025-06-02 v1
摘要
本报告介绍了我们团队(PCIE_EgoPose)在 CVPR2025 EgoExo4D 姿态与熟练度估计挑战赛中的解决方案。针对从 RGB 第一人称视角视频中估计 21 个 3D 手部关节这一复杂任务(该任务受细微运动和频繁遮挡的干扰),我们开发了手部姿态 Vision Transformer (HP-ViT+)。该架构协同结合了 Vision Transformer 和 CNN 主干,并使用加权融合来细化手部姿态预测。对于 EgoExo4D 身体姿态挑战赛,我们采用多模态时空特征整合策略,以应对动态环境下身体姿态估计的复杂性。我们的方法取得了显著性能:在手部姿态挑战赛中 PA-MPJPE 为 8.31,在身体姿态挑战赛中 MPJPE 为 11.25,在两项比赛中均获得冠军。我们将姿态估计解决方案扩展到熟练度估计任务,应用了基于 Transformer 的架构等核心技术。这一扩展使我们在演示者熟练度估计比赛中达到了 0.53 的 top-1 准确率,取得了 SOTA 结果。
引用
@article{arxiv.2505.24411,
title = {PCIE_Pose Solution for EgoExo4D Pose and Proficiency Estimation Challenge},
author = {Feng Chen and Kanokphan Lertniphonphan and Qiancheng Yan and Xiaohui Fan and Jun Xie and Tao Zhang and Zhepeng Wang},
journal= {arXiv preprint arXiv:2505.24411},
year = {2025}
}