中文

DOAD:解耦单阶段动作检测网络

计算机视觉与模式识别 2023-04-05 v2

摘要

从视频中定位人物并识别其动作是一项面向高层视频理解的挑战性任务。现有方法大多基于两阶段,一阶段生成人物边界框,另一阶段进行动作识别。然而,此类两阶段方法通常效率较低。我们观察到,直接统一检测与动作识别通常会受限于(i)因检测与动作识别对上下文表示的不同期望属性导致的次优学习;(ii)训练数据不足带来的优化困难。本工作中,我们提出一个名为DOAD的解耦单阶段网络,以缓解上述问题并提升时空动作检测的效率。为此,我们将检测与动作识别解耦为两个分支。具体而言,一个分支专注于用于行为者检测的检测表示,另一个分支用于动作识别。对于动作分支,我们设计了一个基于Transformer的模块(TransPC)来建模人物与上下文之间的成对关系。不同于自注意力中常用的基于向量的点积,它构建于一种新颖的基于矩阵的键与值之上,通过Hadamard注意力建模人物-上下文信息。其不仅利用了人物对之间的关系,还考虑了上下文与相对位置信息。在AVA与UCF101-24数据集上的结果表明,我们的方法在显著效率提升的同时,可与两阶段最优方法相媲美。

关键词

引用

@article{arxiv.2304.00254,
  title  = {DOAD: Decoupled One Stage Action Detection Network},
  author = {Shuning Chang and Pichao Wang and Fan Wang and Jiashi Feng and Mike Zheng Show},
  journal= {arXiv preprint arXiv:2304.00254},
  year   = {2023}
}

备注

11 pages