构建端到端时空动作检测器的简洁高效流程
计算机视觉与模式识别
2022-10-28 v2
摘要
时空动作检测是视频理解的重要组成部分。当前的时空动作检测方法大多使用目标检测器获取人物候选,并将这些候选分类为不同动作类别。所谓两阶段方法繁重且难以应用于实际场景。一些现有方法构建了单阶段流程,但朴素单阶段流程存在较大性能下降,且需要额外的分类模块才能达到可比性能。本文探索了一种简洁有效的流程以构建强大的单阶段时空动作检测器。该流程由两部分组成:其一是一个简洁的端到端时空动作检测器,所提端到端检测器对当前基于候选的检测器架构改动很小,且不添加额外的动作分类模块;其二是利用稀疏标注数据中未标注帧的新型标注策略。我们将模型命名为SE-STAD。所提SE-STAD实现了约2% mAP提升与约80% FLOPs削减。我们的代码将发布于https://github.com/4paradigm-CV/SE-STAD。
引用
@article{arxiv.2206.03064,
title = {A Simple and Efficient Pipeline to Build an End-to-End Spatial-Temporal Action Detector},
author = {Lin Sui and Chen-Lin Zhang and Lixin Gu and Feng Han},
journal= {arXiv preprint arXiv:2206.03064},
year = {2022}
}
备注
Accepted By WACV 2023