中文

3D 手部姿态在动作识别中的实用性

计算机视觉与模式识别 2024-08-15 v2 机器学习

摘要

3D 手部姿态是动作识别中鲜有被探索的模态。姿态紧凑且信息丰富,可为计算资源受限的应用提供显著优势。然而,姿态本身只能部分理解动作,因无法完全捕捉人类与之交互的物体和环境。我们提出了 HandFormer,一种新型多模态变换器,用于高效建模手部-物体交互。HandFormer 以高时间分辨率的 3D 手部姿态进行细粒度运动建模,同时结合稀疏采样的 RGB 帧用于编码场景语义。观察到手部姿态的独特特征,我们对手部建模进行时间分解,代表每个关节的短期轨迹。这一分解姿态表示结合稀疏 RGB 样本极其高效且准确。仅使用手部姿态的单模态 HandFormer 在计算复杂度降低 5 倍的情况下,超越了现有的骨架基方法。加入 RGB 后,我们在 Assembly101 和 H2O 数据集上实现了动作识别的新型最佳性能,显著提升了以太空姿态感知为导向的动作识别效果。

关键词

引用

@article{arxiv.2403.09805,
  title  = {On the Utility of 3D Hand Poses for Action Recognition},
  author = {Md Salman Shamil and Dibyadip Chatterjee and Fadime Sener and Shugao Ma and Angela Yao},
  journal= {arXiv preprint arXiv:2403.09805},
  year   = {2024}
}

备注

ECCV 2024; https://s-shamil.github.io/HandFormer/