端到端时序动作检测的实证研究
计算机视觉与模式识别
2022-04-07 v1
摘要
时序动作检测(TAD)是视频理解中一项重要但具有挑战性的任务。它旨在同时预测未剪辑视频中每个动作实例的语义标签和时序区间。大多数现有方法采用仅头部学习范式,即视频编码器为动作分类进行预训练,仅编码器之上的检测头部针对TAD进行优化,而非端到端学习。端到端学习的效果尚未得到系统性评估。此外,缺乏对端到端TAD中效率-精度权衡的深入研究。在本文中,我们对端到端时序动作检测进行了实证研究。我们验证了端到端学习相对于仅头部学习的优势,并观察到高达11%的性能提升。此外,我们研究了影响TAD性能和速度的多种设计选择的影响,包括检测头部、视频编码器和输入视频的分辨率。基于这些发现,我们构建了一个中分辨率基线检测器,它在实现端到端方法中最优性能的同时,运行速度提高了4倍以上。我们希望本文能作为端到端学习的指南,并启发该领域的未来研究。代码和模型可在\url{https://github.com/xlliu7/E2E-TAD}获取。
引用
@article{arxiv.2204.02932,
title = {An Empirical Study of End-to-End Temporal Action Detection},
author = {Xiaolong Liu and Song Bai and Xiang Bai},
journal= {arXiv preprint arXiv:2204.02932},
year = {2022}
}
备注
Accepted by CVPR 2022. 13 pages, including supplementary