PointTAD:基于可学习查询点的多标签时序动作检测
计算机视觉与模式识别
2023-03-22 v3
摘要
传统的时序动作检测(TAD)通常处理来自单一标签的、包含少量动作实例的未剪辑视频(例如 ActivityNet、THUMOS)。然而,这种设定可能不切实际,因为不同类别的动作在现实中常常同时发生。本文关注多标签时序动作检测任务,旨在从多标签未剪辑视频中定位所有动作实例。多标签 TAD 更具挑战性,因为它需要在单个视频内进行细粒度类别区分并精确局部化共现实例。为缓解此问题,我们将传统的 TAD 中基于稀疏查询的检测范式进行扩展,提出了 PointTAD 多标签 TAD 框架。具体而言,我们的 PointTAD 引入一小组可学习查询点来表示每个动作实例的关键帧。这种基于点的表示提供了一种灵活机制,可定位边界处的判别帧以及动作内部的关键帧。此外,我们通过多级交互模块执行动作解码过程,以捕获点级和实例级的动作语义。最后,我们的 PointTAD 采用仅基于 RGB 输入的端到端可训练框架,便于部署。我们在两个流行基准上评估了所提方法,并引入了用于多标签 TAD 的 detection-mAP 新指标。在 detection-mAP 指标下,我们的模型大幅优于以往所有方法,在 segmentation-mAP 指标下也取得了有前景的结果。代码见 https://github.com/MCG-NJU/PointTAD。
引用
@article{arxiv.2210.11035,
title = {PointTAD: Multi-Label Temporal Action Detection with Learnable Query Points},
author = {Jing Tan and Xiaotong Zhao and Xintian Shi and Bin Kang and Limin Wang},
journal= {arXiv preprint arXiv:2210.11035},
year = {2023}
}
备注
NeurIPS 2022 camera ready version