中文

用于多模态动作识别的模态混合器

计算机视觉与模式识别 2023-02-22 v2

摘要

在多模态动作识别中,不仅考虑不同模态的互补特性,而且考虑全局动作内容十分重要。本文中,我们提出了一种新颖的网络,称为模态混合器(M-Mixer)网络,以利用跨模态的互补信息和动作的时序上下文进行多模态动作识别。我们还引入了一个简单而有效的循环单元,称为多模态上下文单元(MCU),它是 M-Mixer 的核心组件。我们的 MCU 利用其他模态(例如深度、IR)的动作内容特征对某一模态(例如 RGB)的序列进行时序编码。这一过程鼓励 M-Mixer 利用全局动作内容并补充其他模态的互补信息。因此,我们提出的方法在 NTU RGB+D 60、NTU RGB+D 120 和 NW-UCLA 数据集上优于最先进的方法。此外,我们通过全面的消融实验证明了 M-Mixer 的有效性。

关键词

引用

@article{arxiv.2208.11314,
  title  = {Modality Mixer for Multi-modal Action Recognition},
  author = {Sumin Lee and Sangmin Woo and Yeonju Park and Muhammad Adi Nugroho and Changick Kim},
  journal= {arXiv preprint arXiv:2208.11314},
  year   = {2023}
}

备注

IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2023