中文

将短时 Transformer 适配于未剪辑视频中的动作检测

计算机视觉与模式识别 2024-04-16 v2

摘要

Vision Transformer (ViT) 凭借其灵活的设计、可适配的自注意力机制以及掩码预训练的有效性,在视频识别中展现出巨大潜力。然而,目前尚不清楚如何将这些预训练的短时 ViT 适配于未剪辑视频中的时序动作检测 (TAD)。现有工作将其作为现成的特征提取器,分别处理每个短剪辑片段,而未能捕捉更广时序上下文中不同片段间的细粒度关系。为缓解此问题,本文重点设计一种新机制,将这些预训练 ViT 模型适配为统一的长视频 Transformer,以充分释放其在捕捉片段间关系上的建模能力,同时保持较低的计算开销与内存消耗,从而实现高效的 TAD。为此,我们设计了有效的跨片段传播模块,从两个层级逐步交换不同片段间的短时视频信息。对于主干网络内的信息传播,我们引入跨片段传播策略,以在主干网络内部实现多片段时序特征交互。对于主干网络后的信息传播,我们提出时序 Transformer 层以进行进一步的片段级建模。借助 VideoMAE 预训练的普通 ViT-B,我们的端到端时序动作检测器 (ViT-TAD) 取得了与以往时序动作检测器极具竞争力的性能,在 THUMOS14 上平均 mAP 高达 69.5,在 ActivityNet-1.3 上为 37.40,在 FineAction 上为 17.20。

关键词

引用

@article{arxiv.2312.01897,
  title  = {Adapting Short-Term Transformers for Action Detection in Untrimmed Videos},
  author = {Min Yang and Huan Gao and Ping Guo and Limin Wang},
  journal= {arXiv preprint arXiv:2312.01897},
  year   = {2024}
}

备注

Accepted by CVPR2024