将短时 Transformer 适配于未剪辑视频中的动作检测
计算机视觉与模式识别
2024-04-16 v2
摘要
Vision Transformer (ViT) 凭借其灵活的设计、可适配的自注意力机制以及掩码预训练的有效性,在视频识别中展现出巨大潜力。然而,目前尚不清楚如何将这些预训练的短时 ViT 适配于未剪辑视频中的时序动作检测 (TAD)。现有工作将其作为现成的特征提取器,分别处理每个短剪辑片段,而未能捕捉更广时序上下文中不同片段间的细粒度关系。为缓解此问题,本文重点设计一种新机制,将这些预训练 ViT 模型适配为统一的长视频 Transformer,以充分释放其在捕捉片段间关系上的建模能力,同时保持较低的计算开销与内存消耗,从而实现高效的 TAD。为此,我们设计了有效的跨片段传播模块,从两个层级逐步交换不同片段间的短时视频信息。对于主干网络内的信息传播,我们引入跨片段传播策略,以在主干网络内部实现多片段时序特征交互。对于主干网络后的信息传播,我们提出时序 Transformer 层以进行进一步的片段级建模。借助 VideoMAE 预训练的普通 ViT-B,我们的端到端时序动作检测器 (ViT-TAD) 取得了与以往时序动作检测器极具竞争力的性能,在 THUMOS14 上平均 mAP 高达 69.5,在 ActivityNet-1.3 上为 37.40,在 FineAction 上为 17.20。
引用
@article{arxiv.2312.01897,
title = {Adapting Short-Term Transformers for Action Detection in Untrimmed Videos},
author = {Min Yang and Huan Gao and Ping Guo and Limin Wang},
journal= {arXiv preprint arXiv:2312.01897},
year = {2024}
}
备注
Accepted by CVPR2024