中文

面向 RGB 动态手势识别的多任务与多模态学习

计算机视觉与模式识别 2021-11-01 v1

摘要

由于人机交互中各种应用的可能性,手势识别正变得越来越流行。现有的多模态手势识别系统将多模态数据作为输入以提高准确率,但此类方法需要更多的模态传感器,这将极大限制其应用场景。因此,我们提出一种在训练 2D 卷积神经网络时的端到端多任务学习框架。该框架可在训练时利用深度模态提高准确率,并在推理时仅使用 RGB 模态以节省成本。我们的框架被训练为学习用于多任务学习的表示:手势分割与手势识别。深度模态包含手势位置先验信息,因此可用作手势分割的监督。设计了一个名为 Multi-Scale-Decoder 的即插即用模块来实现手势分割,其包含两个子解码器。它分别用于较低阶段和较高阶段,可帮助网络关注关键目标区域、忽略无关信息并提取更具判别性的特征。此外,MSD 模块与深度模态仅用于训练阶段以提升手势识别性能。推理时仅需 RGB 模态及不含 MSD 的网络。在三个公开手势识别数据集上的实验结果表明,相较现有手势识别框架,我们提出的方法具有更优性能。而且,在其他基于 2D CNN 的框架中使用所提出的即插即用 MSD 也获得了出色的准确率提升。

关键词

引用

@article{arxiv.2110.15639,
  title  = {Multi-Task and Multi-Modal Learning for RGB Dynamic Gesture Recognition},
  author = {Dinghao Fan and Hengjie Lu and Shugong Xu and Shan Cao},
  journal= {arXiv preprint arXiv:2110.15639},
  year   = {2021}
}