中文

基于令牌丢弃与上下文精炼的高效视频动作检测

计算机视觉与模式识别 2023-08-29 v3

摘要

带有大规模视频令牌的流式视频片段阻碍了视觉 transformer(ViT)的高效识别,尤其在视频动作检测中,精确的行为体识别需要充分的时空表征。本工作中,我们提出一种基于原生 ViT 的端到端高效视频动作检测框架(EVAD)。我们的 EVAD 包含两项针对视频动作检测的特殊设计。首先,我们从以关键帧为中心的角度提出时空令牌丢弃:在一个视频片段中,保留其关键帧的所有令牌,保留与其他帧中行为体运动相关的令牌,并丢弃该片段中的其余令牌。其次,我们利用剩余令牌精炼场景上下文,以更好地识别行为体身份。我们动作检测器中的感兴趣区域(RoI)被扩展至时域;所捕获的时空行为体身份表征通过带注意力机制的解码器中的场景上下文进行精炼。这两项设计使我们的 EVAD 在保持精度的同时高效,并在三个基准数据集(即 AVA、UCF101-24、JHMDB)上得到验证。相较于原生 ViT 骨干,我们的 EVAD 将总体 GFLOPs 降低 43%,并以无性能下降将实时推理速度提升 40%。此外,即便在相似计算成本下,我们的 EVAD 借助更高分辨率输入可将性能提升 1.1 mAP。代码见 https://github.com/MCG-NJU/EVAD。

关键词

引用

@article{arxiv.2304.08451,
  title  = {Efficient Video Action Detection with Token Dropout and Context Refinement},
  author = {Lei Chen and Zhan Tong and Yibing Song and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2304.08451},
  year   = {2023}
}

备注

technical report