中文

无需上千候选框:视频中单发演员-动作检测

计算机视觉与模式识别 2020-11-24 v1

摘要

我们提出SSA2D,一种简洁而高效的端到端深度网络,用于视频中的演员-动作检测。现有方法采用基于区域候选框(RPN)的自顶向下方案,其中动作基于检测到的候选框估计,并辅以非极大抑制等后处理。尽管在性能上有效,这些方法在密集视频场景中的可扩展性受限,且因需上千候选框而内存需求高。我们提出从另一视角解决该问题:无需任何候选框。SSA2D是一个统一网络,以单发方式在像素级联合进行演员-动作检测,其中检测到的演员的每个像素都被赋予一个动作标签。SSA2D有两个主要优势:1)它是全卷积网络,不需要任何候选框与后处理,使其内存与时间均高效;2)它易于扩展到密集视频场景,因其内存需求与场景中演员数量无关。我们在Actor-Action数据集(A2D)与Video Object Relation(VidOR)数据集上评估所提方法,证明了其在视频中多演员与动作检测的有效性。与先前工作相比,SSA2D在推理时快11倍,性能相当(有时更优)且网络参数更少。

关键词

引用

@article{arxiv.2011.10927,
  title  = {We don't Need Thousand Proposals$\colon$ Single Shot Actor-Action Detection in Videos},
  author = {Aayush J Rana and Yogesh S Rawat},
  journal= {arXiv preprint arXiv:2011.10927},
  year   = {2020}
}

备注

8 pages