E2E-LOAD:端到端长视频在线动作检测
计算机视觉与模式识别
2023-08-25 v2
摘要
近来,基于特征的方法用于在线动作检测(OAD)呈增长趋势。然而,这些方法因其固定的骨干网络设计而存在局限,忽视了可训练骨干网络的潜在能力。本文中,我们提出首个端到端 OAD 模型,称为 E2E-LOAD,旨在应对 OAD 的主要挑战,即长期理解与高效在线推理。具体而言,我们提出的方法采用由所有帧共享的初始空间模型,并以低计算成本维护长序列缓存用于推理。我们还倡导一种非对称时空模型以有效进行长片段与短片段建模。此外,我们提出一种新颖高效的推理机制,加速繁重的时空探索。大量消融研究与实验证明了我们所提方法的有效性与高效性。值得注意的是,我们在 THUMOS14、TVSeries 和 HDD 上分别以 17.3(+12.6)FPS 实现端到端 OAD,mAP 分别为 72.4%(+1.2%)、90.3%(+0.7%)和 48.1%(+26.0%),比先前方法快 3 倍。源代码将公开可用。
引用
@article{arxiv.2306.07703,
title = {E2E-LOAD: End-to-End Long-form Online Action Detection},
author = {Shuqiang Cao and Weixin Luo and Bairui Wang and Wei Zhang and Lin Ma},
journal= {arXiv preprint arXiv:2306.07703},
year = {2023}
}