中文

面向单阶段连续手势识别的多模态融合

计算机视觉与模式识别 2021-09-22 v2

摘要

手势识别是一个被广泛研究的研究领域,具有包括机器人和人机交互在内的众多实际应用。当前的手势识别方法集中于识别孤立手势,而现有的连续手势识别方法局限于两阶段方法,其中检测与分类需要独立的模型,且后者的性能受限于检测性能。相比之下,我们提出了一种称为时序多模态融合(Temporal Multi-Modal Fusion, TMMF)的单阶段连续手势识别框架,可通过单一模型在视频中检测并分类多个手势。该方法学习手势与非手势之间的自然过渡,无需用于检测单个手势的预处理分割步骤。为此,我们引入了一种多模态融合机制,以支持从多模态输入流入的重要信息的整合,并且可扩展至任意数量的模态。此外,我们提出了单模态特征映射(Unimodal Feature Mapping, UFM)和多模态特征映射(Multi-modal Feature Mapping, MFM)模型,分别用于映射单模态特征和融合后的多模态特征。为了进一步提升性能,我们提出了一种基于中点的损失函数,促进真值与预测之间的平滑对齐,帮助模型学习自然的手势过渡。我们展示了所提框架的实用性,其可处理变长输入视频,并在三个具有挑战性的数据集 EgoGesture、IPN hand 和 ChaLearn LAP Continuous Gesture Dataset (ConGD) 上优于当前最优方法。此外,消融实验表明了所提框架中不同组件的重要性。

关键词

引用

@article{arxiv.2011.04945,
  title  = {Multi-modal Fusion for Single-Stage Continuous Gesture Recognition},
  author = {Harshala Gammulle and Simon Denman and Sridha Sridharan and Clinton Fookes},
  journal= {arXiv preprint arXiv:2011.04945},
  year   = {2021}
}

备注

Accepted for publication in IEEE Transactions on Image Processing