中文

MVAFormer:基于RGB的多视角时空动作识别Transformer

计算机视觉与模式识别 2025-11-05 v1

摘要

多视角动作识别旨在利用多个摄像头视角识别人类动作,并处理由障碍物或人群引起的遮挡。在此任务中,视角间的协作至关重要,它通过组合多个视角来生成联合表示。先前的研究已经探索了有前景的协作方法来提升性能。然而,由于它们的方法仅关注从整个视频中识别单个动作的任务设置,因此不适用于最近流行的时空动作识别(STAR)设置,在该设置中,每个人的动作被顺序识别。为了解决这个问题,本文提出了一种适用于STAR设置的多视角动作识别方法,称为MVAFormer。在MVAFormer中,我们引入了一种新颖的基于Transformer的视角间协作模块。与先前利用丢失空间信息的嵌入向量的研究不同,我们的模块利用特征图进行STAR设置中的有效协作,从而保留了空间信息。此外,在我们的模块中,我们将相同视角和不同视角的自注意力分开,以有效建模多个视角之间的关系。使用新收集数据集进行的实验结果表明,MVAFormer在F-measure上比对比基线高出约4.4个点。

关键词

引用

@article{arxiv.2511.02473,
  title  = {MVAFormer: RGB-based Multi-View Spatio-Temporal Action Recognition with Transformer},
  author = {Taiga Yamane and Satoshi Suzuki and Ryo Masumura and Shotaro Tora},
  journal= {arXiv preprint arXiv:2511.02473},
  year   = {2025}
}

备注

Selected as Best Industry Paper Award at ICIP2024