中文

PERF-Net:姿态增强的 RGB-光流网络

计算机视觉与模式识别 2021-10-22 v2

摘要

近年来,视频动作识别领域的许多工作表明,双流模型(结合空间与时间输入流)对于达到最先进性能是必要的。在本文中,我们展示了基于从每帧估计的人体姿态(具体通过将姿态渲染在输入 RGB 帧上)引入另一流的益处。乍看之下,这一额外流或许显得冗余,因为人体姿态完全由 RGB 像素值决定——然而我们表明(或许令人惊讶地)这一简单而灵活的添加可以提供互补的增益。利用这一洞见,我们随后提出一个新模型,称之为 PERF-Net(Pose Empowered RGB-Flow Net 的缩写),它通过蒸馏技术将该新姿态流与标准的 RGB 和基于光流的输入流结合,并表明我们的模型在多个人的动作识别数据集上大幅优于最先进水平,同时在推理时不需要显式计算光流或姿态。所提出的姿态流也是 ActivityNet Kinetics Challenge 2020 冠军方案的一部分。

关键词

引用

@article{arxiv.2009.13087,
  title  = {PERF-Net: Pose Empowered RGB-Flow Net},
  author = {Yinxiao Li and Zhichao Lu and Xuehan Xiong and Jonathan Huang},
  journal= {arXiv preprint arXiv:2009.13087},
  year   = {2021}
}

备注

10 pages, 5 figures, 7 tables