基于多时间尺度的时序动作定位
计算机视觉与模式识别
2022-08-17 v1
摘要
时序动作定位在视频分析中起着重要作用,旨在未裁剪视频中定位并分类动作。以往方法常于单一时间尺度特征空间上预测动作。然而,低层尺度的时间特征缺乏足够的语义用于动作分类,而高层尺度无法提供动作边界的丰富细节。为解决此问题,我们提出在多时间尺度特征空间上预测动作。具体而言,我们使用不同尺度的精炼特征金字塔将语义从高层尺度传递至低层尺度。此外,为建立整个视频的长时间尺度,我们使用时空 transformer 编码器捕获视频帧的长程依赖。随后,具有长程依赖的精炼特征被送入分类器以进行粗粒度动作预测。最后,为进一步提升预测精度,我们提出使用帧级自注意力模块来精炼每个动作实例的分类与边界。大量实验表明,所提方法在 THUMOS14 数据集上优于当前最优方法,并在 ActivityNet1.3 数据集上取得可比性能。在 THUMOS14 数据集上相较于 A2Net (TIP20, Avg{0.3:0.7})、Sub-Action (CSVT2022, Avg{0.1:0.5}) 和 AFSD (CVPR21, Avg{0.3:0.7}),所提方法分别实现了 12.6%、17.4% 和 2.2% 的提升。
引用
@article{arxiv.2208.07493,
title = {Temporal Action Localization with Multi-temporal Scales},
author = {Zan Gao and Xinglei Cui and Tao Zhuo and Zhiyong Cheng and An-An Liu and Meng Wang and Shenyong Chen},
journal= {arXiv preprint arXiv:2208.07493},
year = {2022}
}