中文

ModDrop:自适应多模态手势识别

计算机视觉与模式识别 2015-07-21 v2 人机交互 机器学习

摘要

我们提出一种基于多尺度和多模态深度学习的手势检测与定位方法。每个视觉模态在特定空间尺度(如上半身或手的运动)捕获空间信息,整个系统在三个时间尺度上运行。我们技术的关键在于一种训练策略,其利用:i) 对各独立模态的精心初始化;以及 ii) 涉及随机丢弃独立通道(称为ModDrop)的渐进融合,以学习跨模态相关性,同时保留每个模态特定表示的独特性。我们在ChaLearn 2014 Looking at People Challenge手势识别赛道上进行了实验,在17支队伍中获得第一。在多个空间和时间尺度上融合多模态显著提高了识别率,使模型能够补偿单个分类器的错误以及独立通道中的噪声。此外,所提出的ModDrop训练技术确保了分类器对一或多个通道中信号缺失的鲁棒性,从而能从任意数量的可用模态产生有意义的预测。另外,我们通过在同一数据集上增加音频进行的实验,展示了所提融合方案对任意性质模态的适用性。

关键词

引用

@article{arxiv.1501.00102,
  title  = {ModDrop: adaptive multi-modal gesture recognition},
  author = {Natalia Neverova and Christian Wolf and Graham W. Taylor and Florian Nebout},
  journal= {arXiv preprint arXiv:1501.00102},
  year   = {2015}
}

备注

14 pages, 7 figures