第一人称视角下的精准2D手部姿态与动作识别
计算机视觉与模式识别
2024-07-25 v2
摘要
动作识别对于第一人称视频理解至关重要,它无需用户费力即可对日常生活活动进行自动且连续的监测。现有文献主要关注3D手部姿态输入,这需要计算密集的深度估计网络或佩戴不适的深度传感器。相反,尽管市场上已有能够捕获单张RGB图像的用户友好型智能眼镜,但在利用2D手部姿态进行第一人称动作识别方面的研究仍然不足。本研究旨在通过探索用于第一人称动作识别的2D手部姿态估计领域来填补这一研究空白,并做出两项贡献。首先,我们提出了两种新颖的2D手部姿态估计方法,即用于单手估计的EffHandNet和专为第一人称视角定制的EffHandEgoNet,以捕捉手与物体之间的交互。这两种方法在H2O和FPHA公开基准测试上均优于SOTA模型。其次,我们提出了一种基于2D手部和物体姿态的鲁棒动作识别架构。该方法结合了EffHandEgoNet和一种基于Transformer的动作识别方法。在H2O和FPHA数据集上的评估表明,我们的架构具有更快的推理时间,并分别达到了91.32%和94.43%的准确率,超越了包括基于3D方法在内的SOTA。我们的工作表明,使用2D骨骼数据是进行第一人称动作理解的一种鲁棒方法。广泛的评估和消融实验展示了手部姿态估计方法的影响,以及每个输入如何影响整体性能。
引用
@article{arxiv.2404.09308,
title = {In My Perspective, In My Hands: Accurate Egocentric 2D Hand Pose and Action Recognition},
author = {Wiktor Mucha and Martin Kampel},
journal= {arXiv preprint arXiv:2404.09308},
year = {2024}
}
备注
Accepted at: The 18th IEEE International Conference on Automatic Face and Gesture Recognition