中文

面向RGB-D运动识别的统一多模态解耦与重耦合框架

计算机视觉与模式识别 2023-06-13 v2 多媒体

摘要

运动识别是计算机视觉中一个有前景的方向,但由于数据不足和参数可观,视频分类模型的训练比图像困难得多。为规避此问题,一些工作致力于从RGB-D数据中探索多模态线索。尽管这些方法在一定程度上改进了运动识别,仍面临以下方面的次优境况:(i) 数据增强,即RGB-D数据集规模仍然有限,且鲜有探索针对视频的新颖数据增强策略;(ii) 优化机制,即紧密的时空纠缠网络结构给时空信息建模带来更多挑战;以及(iii) 跨模态知识融合,即多模态表示间的高相似性导致后期融合不足。为缓解这些缺陷,本文提出从数据和算法两个角度改进基于RGB-D的运动识别。更具体地,首先,我们引入一种称为ShuffleMix的新颖视频数据增强方法,作为MixUp的补充,为运动识别提供额外的时序正则化。其次,提出一种称为UMDR的统一多模态解耦与多阶段重耦合框架,用于视频表示学习。最后,探索一种新颖的跨模态互补特征捕捉器(CFCer),以挖掘多模态信息中潜在的共性特征作为辅助融合流,改善后期融合结果。这些新颖设计的无缝结合形成了鲁棒的时空表示,并在四个公开运动数据集上取得了优于最先进方法的性能。具体而言,UMDR在Chalearn IsoGD数据集上取得了+4.5%的空前提升。我们的代码见https://github.com/zhoubenjia/MotionRGBD-PAMI。

关键词

引用

@article{arxiv.2211.09146,
  title  = {A Unified Multimodal De- and Re-coupling Framework for RGB-D Motion Recognition},
  author = {Benjia Zhou and Pichao Wang and Jun Wan and Yanyan Liang and Fan Wang},
  journal= {arXiv preprint arXiv:2211.09146},
  year   = {2023}
}

备注

Accepted to TPAMI 2023