Keypoint Transformer:在困难的手与物体交互中解决关节识别以实现精确三维姿态估计
计算机视觉与模式识别
2022-04-20 v2
摘要
我们提出了一种从单张彩色图像中鲁棒且精确地估计两只紧密交互的手的三维姿态的方法。这是一个极具挑战性的问题,因为可能发生大面积遮挡以及关节之间的诸多混淆。最先进的方法通过为每个关节回归一个热图来解决该问题,这需要同时解决两个任务:定位关节并识别它们。在本工作中,我们提出将这两项任务分离:依靠 CNN 首先将这些关节定位为二维关键点,并利用这些关键点处 CNN 特征之间的自注意力将其与对应的手部关节相关联。由此得到的架构,我们称之为“Keypoint Transformer”,具有极高的效率,因为在 InterHand2.6M 数据集上它以约一半的模型参数量实现了最先进的性能。我们还展示了它可以轻松扩展以高精度估计被一只或两只手操纵的物体的三维姿态。此外,我们创建了一个包含超过 75,000 张两只手操纵物体的图像的新数据集,并进行了完整的三维标注,我们将公开该数据集。
引用
@article{arxiv.2104.14639,
title = {Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose Estimation},
author = {Shreyas Hampali and Sayan Deb Sarkar and Mahdi Rad and Vincent Lepetit},
journal= {arXiv preprint arXiv:2104.14639},
year = {2022}
}
备注
Accepted at CVPR2022