中文

运动融合帧:用于手势识别的数据级融合策略

计算机视觉与模式识别 2018-04-27 v2

摘要

获取动作的时空状态是动作分类中最关键的一步。本文提出一种数据级融合策略——运动融合帧(MFFs),旨在将运动信息融合到静态图像中,以更好地表征动作的时空状态。MFFs可作为任何深度学习架构的输入,仅需对网络做极少量修改。我们在三个视频数据集(Jester、ChaLearn LAP IsoGD和NVIDIA动态手势数据集)上评估MFFs在手势识别任务上的表现,这些任务需要捕捉手部运动的长期时间关系。我们的方法在Jester和ChaLearn基准上分别取得了96.28%和57.4%的分类准确率,极具竞争力,同时在NVIDIA基准上以84.7%的准确率达到了当前最优性能。

关键词

引用

@article{arxiv.1804.07187,
  title  = {Motion Fused Frames: Data Level Fusion Strategy for Hand Gesture Recognition},
  author = {Okan Köpüklü and Neslihan Köse and Gerhard Rigoll},
  journal= {arXiv preprint arXiv:1804.07187},
  year   = {2018}
}

备注

Accepted to CVPR 2018 as workshop paper