Point3D:以移动点结合 3D CNNs 追踪动作
计算机视觉与模式识别
2022-03-22 v1
摘要
时空动作识别一直是一项具有挑战性的任务,涉及检测动作发生的位置与时间。当前最先进的动作检测器大多基于锚框,由于需计算大量锚框,对锚框设计敏感且计算量大。受新兴无锚框方法启发,我们提出 Point3D,一种灵活且计算高效、高精度的时空动作识别网络。我们的 Point3D 由一个用于动作定位的 Point Head 和一个用于动作分类的 3D Head 组成。首先,Point Head 用于追踪人体的中心点与节点关键点以定位动作的边界框。这些位置特征随后被送入时间注意力以学习跨帧的长程依赖。之后部署 3D Head 进行最终的动作分类。我们的 Point3D 在 JHMDB、UCF101-24 和 AVA 基准上于帧-mAP 和视频-mAP 方面取得了最先进性能。全面的消融研究也证明了我们 Point3D 中每个模块的有效性。
引用
@article{arxiv.2203.10584,
title = {Point3D: tracking actions as moving points with 3D CNNs},
author = {Shentong Mo and Jingfei Xia and Xiaoqing Tan and Bhiksha Raj},
journal= {arXiv preprint arXiv:2203.10584},
year = {2022}
}
备注
Accepted by the 32nd British Machine Vision Conference (BMVC 2021)