中文

YOWO-Plus:一种渐进式改进

计算机视觉与模式识别 2022-10-21 v1

摘要

在本技术报告中,我们介绍对 YOWO(一种用于时空动作检测的实时方法)的更新。我们做了一系列微小的设计改动以使其更好。对于网络结构,我们使用官方实现的 YOWO 相同的结构,包括 3D-ResNext-101 和 YOLOv2,但我们使用自行重新实现的 YOLOv2 的更好预训练权重,其优于官方 YOLOv2。我们还优化了 YOWO 中使用的标签分配。为准确检测动作实例,我们采用 GIoU loss 进行边界框回归。经过我们的渐进式改进,YOWO 在 UCF101-24 上取得 84.9\% 帧 mAP 和 50.5\% 视频 mAP,显著高于官方 YOWO。在 AVA 上,我们优化的 YOWO 以 16 帧取得 20.6\% 帧 mAP,同样超过官方 YOWO。以 32 帧计,我们的 YOWO 在 RTX 3090 GPU 上以 25 FPS 取得 21.6 帧 mAP。我们将优化后的 YOWO 命名为 YOWO-Plus。此外,我们用高效的 3D-ShuffleNet-v2 替换 3D-ResNext-101 来设计轻量级动作检测器 YOWO-Nano。YOWO-Nano 在 UCF101-24 上以超过 90 FPS 取得 81.0 \% 帧 mAP 和 49.7\% 视频帧 mAP。它在 AVA 上以约 90 FPS 取得 18.4 \% 帧 mAP。据我们所知,YOWO-Nano 是最快的 state-of-the-art 动作检测器。我们的代码发布于 https://github.com/yjh0410/PyTorch_YOWO。

关键词

引用

@article{arxiv.2210.11219,
  title  = {YOWO-Plus: An Incremental Improvement},
  author = {Jianhua Yang},
  journal= {arXiv preprint arXiv:2210.11219},
  year   = {2022}
}

备注

4 pages, 1 figure