中文

DVANet:用于多视角动作识别的视角与动作特征解耦

计算机视觉与模式识别 2023-12-12 v1

摘要

在本工作中,我们提出了一种用于多视角动作识别的新方法,在该方法中我们引导学习到的动作表示与视频中的视角相关信息相分离。当试图对从多个视角捕获的动作实例进行分类时,由于不同摄像机角度下背景、遮挡以及捕获动作可见性的差异,分类难度更大。为了解决多视角动作识别中引入的各种问题,我们提出了一种可学习的 Transformer 解码器查询的新配置,结合两个有监督对比损失,以强制学习对视角变化具有鲁棒性的动作特征。我们的解耦特征学习分两个阶段进行:Transformer 解码器使用独立的查询分别学习动作和视角信息,随后使用我们的两个对比损失进一步对其进行解耦。我们表明,我们的模型和训练方法在四个多视角动作识别数据集(NTU RGB+D、NTU RGB+D 120、PKU-MMD 和 N-UCLA)上显著优于所有其他单模态模型。与以往的 RGB 工作相比,我们在每个数据集上分别获得了 1.5%、4.8%、2.2% 和 4.8% 的最大提升。

关键词

引用

@article{arxiv.2312.05719,
  title  = {DVANet: Disentangling View and Action Features for Multi-View Action Recognition},
  author = {Nyle Siddiqui and Praveen Tirupattur and Mubarak Shah},
  journal= {arXiv preprint arXiv:2312.05719},
  year   = {2023}
}