YOWOv2:一种更强且高效的实时时空动作检测多级检测框架
计算机视觉与模式识别
2023-06-09 v2
摘要
设计用于时空动作检测任务的实时框架仍具挑战性。本文提出一种新颖的实时动作检测框架 YOWOv2。在该新框架中,YOWOv2 利用 3D 主干和 2D 主干的优势以实现准确的动作检测。设计了一种多级检测流水线来检测不同尺度的动作实例。为实现此目标,我们精心构建了一个带有特征金字塔网络的简单高效的 2D 主干,以提取不同层次的分类特征和回归特征。对于 3D 主干,我们采用现有的高效 3D CNN 以节省开发时间。通过组合不同尺寸的 3D 主干和 2D 主干,我们设计了包括 YOWOv2-Tiny、YOWOv2-Medium 和 YOWOv2-Large 的 YOWOv2 系列。我们还引入了流行的动态标签分配策略和 anchor-free 机制,使 YOWOv2 与先进的模型架构设计保持一致。经改进,YOWOv2 显著优于 YOWO,且仍能保持实时检测。无需任何额外技巧,YOWOv2 在 UCF101-24 上以超过 20 FPS 取得 87.0 % 帧 mAP 和 52.8 % 视频 mAP。在 AVA 上,YOWOv2 以超过 20 FPS 取得 21.7 % 帧 mAP。我们的代码发布于 https://github.com/yjh0410/YOWOv2。
引用
@article{arxiv.2302.06848,
title = {YOWOv2: A Stronger yet Efficient Multi-level Detection Framework for Real-time Spatio-temporal Action Detection},
author = {Jianhua Yang and Kun Dai},
journal= {arXiv preprint arXiv:2302.06848},
year = {2023}
}