探索时序动作定位中更强的特征
计算机视觉与模式识别
2021-06-25 v1
摘要
时序动作定位旨在定位动作的起始与结束时间并给出动作类别。受限于 GPU 显存,主流方法为每个视频预先提取特征。因此,特征质量决定了检测性能的上限。在本技术报告中,我们探索了经典的基于卷积的主干网络与近期兴起的基于 transformer 的主干网络。我们发现基于 transformer 的方法能取得比基于卷积的方法更好的分类性能,但它们无法生成准确的动作提议。此外,以更大的帧分辨率提取特征以减少空间信息损失,也能有效提升时序动作定位的性能。最后,通过简单组合 BMN+TCANet,我们使用单一的 SlowFast 特征在验证集上取得了 42.42% 的 mAP,比 2020 年多模型集成的结果高出 1.87%。最终,我们在 CVPR2021 HACS 有监督时序动作定位挑战赛上取得第 1 名。
引用
@article{arxiv.2106.13014,
title = {Exploring Stronger Feature for Temporal Action Localization},
author = {Zhiwu Qing and Xiang Wang and Ziyuan Huang and Yutong Feng and Shiwei Zhang and jianwen Jiang and Mingqian Tang and Changxin Gao and Nong Sang},
journal= {arXiv preprint arXiv:2106.13014},
year = {2021}
}
备注
Rank 1st on the CVPR2021 HACS supervised Temporal Action Localization Challenge