中文

基于多流运动建模与互信息最大化的动作识别

计算机视觉与模式识别 2024-12-30 v1

摘要

动作识别长期以来是人工智能中一个基础且引人入胜的问题。由于动作的高维本质以及需要考虑的细微运动细节,该任务具有挑战性。当前最先进的方法通常在直接的 3D 欧氏空间中从关节运动序列学习。然而,朴素欧氏空间对于建模重要的运动特征(如揭示运动背后驱动力的关节角加速度)并不高效。此外,当前方法通常平等对待各通道,且缺乏对从输入中提取任务相关特征的理论约束。本文中,我们力求从三方面应对这些挑战:(1) 我们提出引入加速度表示,显式建模运动中的高阶变化。(2) 我们引入一种新颖的配备多流组件与通道注意力的 Stream-GCN 网络,其中不同表示(即流)相互补充以实现更精确的动作识别,而注意力则充分利用那些重要通道。(3) 我们探索特征级监督以最大化任务相关信息提取,并将其表述为互信息损失。在经验上,我们的方法在三个基准数据集 NTU RGB+D、NTU RGB+D 120 和 NW-UCLA 上确立了新的 SOTA 性能。我们的代码匿名发布于 https://github.com/ActionR-Group/Stream-GCN,希望能启发社区。

关键词

引用

@article{arxiv.2306.07576,
  title  = {Action Recognition with Multi-stream Motion Modeling and Mutual Information Maximization},
  author = {Yuheng Yang and Haipeng Chen and Zhenguang Liu and Yingda Lyu and Beibei Zhang and Shuang Wu and Zhibo Wang and Kui Ren},
  journal= {arXiv preprint arXiv:2306.07576},
  year   = {2024}
}

备注

9 pages, 5 figures