面向流式视频分析的表征复用
计算机视觉与模式识别
2024-01-09 v4
摘要
我们提出 StreamDEQ,一种旨在以最小逐帧计算量推断视频逐帧表征的方法。传统深度网络在缺乏特定解决方案的情况下,会在每一帧从头进行特征提取。我们转而旨在构建能够原生利用连续视频帧之间时间平滑性的流式识别模型。我们观察到,近期涌现的隐式层模型为构建此类模型提供了便利基础,因为它们将表征定义为浅层网络的固定点,需使用迭代方法进行估计。我们的核心思路是,在每一帧使用最近的表征作为起点,将推断迭代分布到时间轴上。该方案有效复用了近期的推断计算,并大幅减少了所需处理时间。通过广泛的实验分析,我们表明 StreamDEQ 能够在几帧时间内恢复近最优表征,并在整个视频时长内维持最新表征。我们在视频语义分割、视频目标检测和视频人体姿态估计上的实验表明,StreamDEQ 在达到与基线相当精度的同时,速度提升超过 2-4 倍。
引用
@article{arxiv.2204.13492,
title = {Representation Recycling for Streaming Video Analysis},
author = {Can Ufuk Ertenli and Ramazan Gokberk Cinbis and Emre Akbas},
journal= {arXiv preprint arXiv:2204.13492},
year = {2024}
}
备注
v3: ECCV2022 paper. This version: extended version under review at TPAMI