为高效通用事件边界检测重新思考架构设计
计算机视觉与模式识别
2024-07-18 v1
摘要
通用事件边界检测(GEBD)受人类视觉认知持续将视频分割为有意义时序块的行为启发,发现其在视频编辑等各种应用中具有实用性。在本文中,我们表明SOTA GEBD模型往往在最终性能和模型复杂度之间进行权衡,导致推理速度较慢,阻碍在实际场景中高效部署。我们通过实验性地重新审视GEBD模型的架构,揭示了若干意想不到的发现。首先,我们发现简洁的GEBD基线模型即无需任何复杂设计就已实现令人期待的性能。其次,我们发现GEBD模型中广泛应用的图像域主干网络中可能包含大量架构冗余,促使我们逐步将其“现代化”,以提高效率。第三,我们表明,GEBD模型使用图像域主干以空间-随后-时间的贪婪方式进行时空学习时可能遭遇分心问题,这可能是GEBD效率低下的“凶手”。使用视频域主干联合进行时空建模是解决此问题的有效方法。我们研究结果的产出是一系列GEBD模型,命名为EfficientGEBD,在相同主干网络下相较于先前SOTA方法实现最高可达1.7%的性能提升和280%的加速。我们的研究促使社区在考虑模型复杂度的前提下设计现代GEBD方法,特别是在资源受限的应用中。代码可在\url{https://github.com/Ziwei-Zheng/EfficientGEBD}获取。
引用
@article{arxiv.2407.12622,
title = {Rethinking the Architecture Design for Efficient Generic Event Boundary Detection},
author = {Ziwei Zheng and Zechuan Zhang and Yulin Wang and Shiji Song and Gao Huang and Le Yang},
journal= {arXiv preprint arXiv:2407.12622},
year = {2024}
}
备注
ACM MM 2024