时序动作定位模型的数据效率与计算效率基准测试
计算机视觉与模式识别
2023-08-28 v1
摘要
在时序动作定位中,给定输入视频,目标是预测其包含哪些动作、动作从何处开始以及何处结束。训练和测试当前最先进的深度学习模型需要大量数据与计算能力。然而,收集此类数据具有挑战性,且计算资源可能受限。本工作探索并度量了当前深度时序动作定位模型在数据量或计算能力受限设定下的表现。我们通过在每个模型上使用训练集子集训练来度量数据效率。我们发现 TemporalMaxer 在数据受限设定下优于其他模型。此外,当训练时间受限时,我们推荐 TriDet。为测试推理阶段模型的效率,我们将不同长度的视频输入各模型。我们发现 TemporalMaxer 所需计算资源最少,这可能源于其简洁的架构。
引用
@article{arxiv.2308.13082,
title = {Benchmarking Data Efficiency and Computational Efficiency of Temporal Action Localization Models},
author = {Jan Warchocki and Teodor Oprescu and Yunhan Wang and Alexandru Damacus and Paul Misterka and Robert-Jan Bruintjes and Attila Lengyel and Ombretta Strafforello and Jan van Gemert},
journal= {arXiv preprint arXiv:2308.13082},
year = {2023}
}
备注
Accepted to the CVEU workshop at ICCV 2023