中文

STMixer:一阶段稀疏动作检测器

计算机视觉与模式识别 2024-04-16 v1

摘要

传统的视频动作检测器通常采用两阶段流程,首先使用人体检测器生成演员边界框,然后使用 3D RoIAlign 提取特定于演员的特征进行分类。这种检测范式需要多阶段训练和推理,并且特征采样被限制在边界框内,未能有效利用外部更丰富的上下文信息。最近,提出了一些基于查询的动作检测器,以端到端的方式预测动作实例。然而,它们在特征采样和解码方面仍然缺乏适应性,因此存在性能较差或收敛较慢的问题。在本文中,我们为更灵活的一阶段稀疏动作检测器提出了两个核心设计。首先,我们提出了一个基于查询的自适应特征采样模块,该模块赋予检测器从整个时空域挖掘一组判别性特征的灵活性。其次,我们设计了一个解耦特征混合模块,该模块分别沿空间和时间维度动态关注并混合视频特征,以实现更好的特征解码。基于这些设计,我们实例化了两种检测流程,即用于关键帧动作检测的 STMixer-K 和用于动作小管检测的 STMixer-T。无需多余的修饰,我们的 STMixer 检测器在五个用于关键帧动作检测或动作管检测的具有挑战性的时空动作检测基准上取得了 SOTA 结果。

关键词

引用

@article{arxiv.2404.09842,
  title  = {STMixer: A One-Stage Sparse Action Detector},
  author = {Tao Wu and Mengqi Cao and Ziteng Gao and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2404.09842},
  year   = {2024}
}

备注

Extended version of the paper arXiv:2303.15879 presented at CVPR 2023. Accepted by TPAMI 2024