基于 Transformer 的双手操作物体场景下的全局三维手姿估计
计算机视觉与模式识别
2022-10-21 v1
摘要
本报告描述了我们在 ECCV 2022 以自我为中心和多视角相机人体、手与活动(HBHA)挑战赛(手姿估计)中获得第一名的方案。在该挑战中,我们的目标是从输入图像中估计全局三维手姿,图像为以自我为中心视角下双手与物体交互的场景。我们提出的方法通过 transformer 架构进行端到端的多手姿态估计。具体而言,我们的方法在双手交互的场景下能鲁棒地估计手姿。此外,我们提出了一种考虑手部尺度的算法,以鲁棒估计绝对深度。所提算法即使在每个人手部大小各异时也能良好工作。我们的方法在测试集上每只手分别达到 14.4 mm(左)和 15.9 mm(右)的误差。
引用
@article{arxiv.2210.11384,
title = {Transformer-based Global 3D Hand Pose Estimation in Two Hands Manipulating Objects Scenarios},
author = {Hoseong Cho and Donguk Kim and Chanwoo Kim and Seongyeong Lee and Seungryul Baek},
journal= {arXiv preprint arXiv:2210.11384},
year = {2022}
}
备注
5 pages