MS-TCT:用于动作检测的多尺度时间卷积-Transformer
计算机视觉与模式识别
2022-03-30 v2
摘要
动作检测是一项基础且具有挑战性的任务,尤其是对于未修剪视频的密集标注数据集。这些数据集中的时间关系复杂,包含复合动作、共存动作等挑战。为检测这些复杂视频中的动作,高效捕获视频中短期与长期时间信息至关重要。为此,我们提出一种新颖的用于动作检测的 ConvTransformer 网络。该网络包含三个主要组件:(1)时间编码器模块在多种时间分辨率下广泛探索全局与局部时间关系。(2)时间尺度混合模块有效融合多尺度特征以获得统一的特征表示。(3)分类模块用于学习实例中心相对位置并预测帧级分类分数。在包括 Charades、TSU 与 MultiTHUMOS 的多个数据集上的大量实验证实了我们所提方法的有效性。我们的网络在所有三个数据集上均优于当前最优(SOTA)方法。
引用
@article{arxiv.2112.03902,
title = {MS-TCT: Multi-Scale Temporal ConvTransformer for Action Detection},
author = {Rui Dai and Srijan Das and Kumara Kahatapitiya and Michael S. Ryoo and Francois Bremond},
journal= {arXiv preprint arXiv:2112.03902},
year = {2022}
}
备注
Accepted in CVPR 2022