中文

SparseTem:利用时间连续性提升基于 CNN 的视频编码器效率

计算机视觉与模式识别 2025-08-12 v2

摘要

深度学习模型已成为视频处理领域的关键,并在自动驾驶和目标检测等实际应用中日益重要。尽管 Vision Transformers (ViTs) 已展现出其强大能力,但卷积神经网络仍是用于特征提取和编码的高效且高性能选择。然而,卷积运算密集的计算需求阻碍了其作为视频编码器的更广泛应用。鉴于视频帧固有的时间连续性,连续帧之间的变化极小,允许跳过冗余计算。我们将此技术称为 Diff Computation,它带来两个主要挑战。首先,Diff Computation 需要缓存中间特征图以确保非线性计算的正确性,导致显著的内存消耗。其次,Diff Computation 引入的各层间稀疏性不平衡会导致精度下降。为解决这些问题,我们提出了一种内存高效的调度方法以消除内存开销,并提出了一种在线调整机制以最小化精度下降。我们将这些技术集成到框架 SparseTem 中,以无缝支持各种基于 CNN 的视频编码器。SparseTem 在 EfficientDet 上实现了 1.79 倍的加速,在 CRNN 上实现了 4.72 倍的加速,且精度下降极小,无额外内存开销。大量实验结果表明,SparseTem 通过有效利用时间连续性加速基于 CNN 的视频编码器,创造了新的 SOTA。

关键词

引用

@article{arxiv.2410.20790,
  title  = {SparseTem: Boosting the Efficiency of CNN-Based Video Encoders by Exploiting Temporal Continuity},
  author = {Kunyun Wang and Shuo Yang and Jieru Zhao and Wenchao Ding and Quan Chen and Jingwen Leng and Minyi Guo},
  journal= {arXiv preprint arXiv:2410.20790},
  year   = {2025}
}

备注

9 pages, 13 figures