中文

YOWOv3:面向人类动作检测与识别的高效通用框架

计算机视觉与模式识别 2024-08-12 v2

摘要

本文提出一种名为 YOWOv3 的新框架,是为人类动作检测与识别任务而设计的 YOWOv2 的改进版本。该框架旨在促进对不同配置的广泛实验,支持对模型各组件进行轻松定制,减少理解和修改代码的工作量。YOWOv3 在两个广泛用于人类动作检测与识别的数据集(UCF101-24 和 AVAv2.2)上性能显著优于 YOWOv2。具体而言,前一模型 YOWOv2 在 UCF101-24 和 AVAv2.2 上的 mAP 分别为 85.2% 和 20.3%,参数量为 109.7M,计算量为 53.6 GFLOPs。相比之下,我们的模型 YOWOv3 仅需 59.8M 参数和 39.8 GFLOPs,分别在 UCF101-24 和 AVAv2.2 上实现 88.33% 和 20.31% 的 mAP。结果表明,YOWOv3 在保持可比性能的同时,显著减少了参数数量和计算量。

关键词

引用

@article{arxiv.2408.02623,
  title  = {YOWOv3: An Efficient and Generalized Framework for Human Action Detection and Recognition},
  author = {Duc Manh Nguyen Dang and Viet Hang Duong and Jia Ching Wang and Nhan Bui Duc},
  journal= {arXiv preprint arXiv:2408.02623},
  year   = {2024}
}