中文

用于基于 RGB-D 动作识别的时空表征解耦与重耦

计算机视觉与模式识别 2021-12-17 v1

摘要

解耦时空表征是指将空间和时间特征分解为维度独立的因子。尽管先前基于 RGB-D 的动作识别方法通过紧密耦合的多模态时空表征取得了良好的性能,但它们仍然存在以下问题:(i)由于紧密的时空纠缠建模,在小数据设置下存在优化困难;(ii)信息冗余,因为其通常包含大量与分类弱相关的边缘信息;(iii)由于后期融合不充分,导致多模态时空信息之间的交互程度低。为了缓解这些缺陷,我们提出对基于 RGB-D 的动作识别的时空表征进行解耦与重耦。具体而言,我们将学习时空表征的任务解耦为三个子任务:(1)通过解耦的空间和时间建模网络学习高质量且维度独立的特征。(2)重耦解耦后的表征以建立更强的时空依赖关系。(3)引入跨模态自适应后验融合(CAPF)机制,以从 RGB-D 数据中捕获跨模态时空信息。这些新颖设计的无缝结合形成了鲁棒的时空表征,并在四个公开动作数据集上取得了优于现有方法的性能。我们的代码可在 https://github.com/damo-cv/MotionRGBD 获取。

关键词

引用

@article{arxiv.2112.09129,
  title  = {Decoupling and Recoupling Spatiotemporal Representation for RGB-D-based Motion Recognition},
  author = {Benjia Zhou and Pichao Wang and Jun Wan and Yanyan Liang and Fan Wang and Du Zhang and Zhen Lei and Hao Li and Rong Jin},
  journal= {arXiv preprint arXiv:2112.09129},
  year   = {2021}
}

备注

open sourced; codes and models are available:https://github.com/damo-cv/MotionRGBD; transformer-based method