中文

STMixer:一种单阶段稀疏动作检测器

计算机视觉与模式识别 2023-03-29 v1

摘要

传统的视频动作检测器通常采用两阶段流程,即先使用人物检测器生成演员边界框,再利用3D RoIAlign提取演员特定特征进行分类。该检测范式需要多阶段训练与推理,且无法捕获边界框之外的上下文信息。近来,已有若干基于查询的动作检测器被提出以端到端方式预测动作实例。然而,它们在特征采样与解码上仍缺乏适应性,因而面临性能不佳或收敛较慢的问题。本文提出一种新的单阶段稀疏动作检测器,称为STMixer。STMixer基于两项核心设计。首先,我们提出基于查询的自适应特征采样模块,使STMixer具备从整个时空域中挖掘一组判别性特征的灵活性。其次,我们设计双分支特征混合模块,使STMixer能够分别沿空间维度和时间维度动态关注并混合视频特征,以实现更好的特征解码。将这两项设计与视频骨干网络结合,得到一个高效的端到端动作检测器。无需额外技巧,我们的STMixer在AVA、UCF101-24和JHMDB数据集上取得了最先进的结果。

关键词

引用

@article{arxiv.2303.15879,
  title  = {STMixer: A One-Stage Sparse Action Detector},
  author = {Tao Wu and Mengqi Cao and Ziteng Gao and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2303.15879},
  year   = {2023}
}

备注

Accepted by CVPR 2023