AssemblyHands:通过三维手姿估计实现以自我为中心的活动理解
计算机视觉与模式识别
2023-04-25 v1
摘要
我们提出AssemblyHands,一个带有精确三维手姿标注的大规模基准数据集,以促进对具有挑战性手-物交互的以自我为中心活动的研究。该数据集包含从近期Assembly101数据集中采样的同步以自我为中心和以外为中心图像,其中参与者组装和拆卸可拆玩具。为获取以自我为中心图像的高质量三维手姿标注,我们开发了一条高效流水线,使用一组初始手动标注训练模型以自动标注远更大的数据集。我们的标注模型采用多视角特征融合与迭代优化方案,达到平均关键点误差4.20 mm,比Assembly101中原始标注误差低85%。AssemblyHands提供3.0M标注图像,包括490K张以自我为中心图像,使其成为现有最大的以自我为中心三维手姿估计基准数据集。利用该数据,我们开发了从以自我为中心图像进行三维手姿估计的强单视角基线。此外,我们设计了一种新颖的动作分类任务来评估预测的三维手姿。我们的研究表明,拥有更高质量的手姿可直接提升识别动作的能力。
引用
@article{arxiv.2304.12301,
title = {AssemblyHands: Towards Egocentric Activity Understanding via 3D Hand Pose Estimation},
author = {Takehiko Ohkawa and Kun He and Fadime Sener and Tomas Hodan and Luan Tran and Cem Keskin},
journal= {arXiv preprint arXiv:2304.12301},
year = {2023}
}
备注
CVPR 2023. Project page: https://assemblyhands.github.io/