带有 RGB-D 视频与 3D 手部姿态标注的第一人称手部动作基准
计算机视觉与模式识别
2018-04-11 v2
摘要
在本工作中,我们研究利用 3D 手部姿态来识别与 3D 物体交互的第一人称动态手部动作。为实现此目标,我们收集了由超过 100K 帧的 RGB-D 视频序列组成的数据,涵盖 45 个日常手部动作类别,涉及 26 个不同物体及若干手部构型。为获取手部姿态标注,我们使用自研的 mo-cap(动作捕捉)系统,通过 6 个磁传感器与逆运动学自动推断手部模型 21 个关节中每一个的 3D 位置。此外,我们记录了 6D 物体姿态,并为手部-物体交互序列的一个子集提供了 3D 物体模型。据我们所知,这是首个支持利用 3D 手部姿态研究第一人称手部动作的基准(benchmark)。我们给出了基于 18 种基线/state-of-the-art 方法的 RGB-D 与基于姿态的动作识别的广泛实验评估。使用外观特征、姿态及其组合的影响被度量,不同的训练/测试协议也被评估。最后,我们评估了在自我中心视角下手部被物体严重遮挡时,3D 手部姿态估计领域的成熟程度及其对动作识别的影响。从结果中,我们观察到与其他数据模态相比,使用手部姿态作为动作识别线索的明显益处。我们的数据集与实验可能引起 3D 手部姿态估计、6D 物体姿态、机器人学以及动作识别领域的关注。
引用
@article{arxiv.1704.02463,
title = {First-Person Hand Action Benchmark with RGB-D Videos and 3D Hand Pose Annotations},
author = {Guillermo Garcia-Hernando and Shanxin Yuan and Seungryul Baek and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:1704.02463},
year = {2018}
}
备注
Accepted to CVPR 2018