FrameHopper:检测驱动实时视频分析中对视频帧的选择性处理
计算机视觉与模式识别
2022-03-23 v1 多媒体
图像与视频处理
摘要
检测驱动的实时视频分析需要使用 YOLOV3、EfficientDet 等深度学习模型对视频帧中的目标进行连续检测。然而,在资源受限的边缘设备上对每一帧运行这些检测器计算量巨大。考虑到连续视频帧间的时间相关性,我们注意到检测输出在相邻帧中往往存在重叠。剔除相似的连续帧只会导致性能轻微下降,却能通过降低总体计算与通信成本带来显著的性能收益。因此,关键技术问题在于:(a)如何识别应由目标检测器处理的帧;(b)一旦选定某帧进行处理,可跳过多少连续帧(称为跳过长度)。该过程的整体目标是使因跳帧产生的误差尽可能小。我们针对目标检测任务提出一种关于误差与处理率的新型优化问题,在误差率与帧过滤比例间取得平衡。随后,我们提出一种基于离线强化学习(RL)的算法,从已录制视频中确定这些跳过长度作为 RL 智能体的状态-动作策略,再将该智能体在线部署于实时视频流。为此,我们开发了 FrameHopper——一个边-云协同视频分析框架,其在摄像头端运行轻量级训练好的 RL 智能体,并将过滤后的帧传至服务器端,由目标检测模型执行一系列应用。我们在真实场景捕获的多个实时视频上测试了该方法,结果表明 FrameHopper 仅处理极少数帧,却能产生接近最优解的的检测结果,并在多数情况下优于近期最先进的方案。
引用
@article{arxiv.2203.11493,
title = {FrameHopper: Selective Processing of Video Frames in Detection-driven Real-Time Video Analytics},
author = {Md Adnan Arefeen and Sumaiya Tabassum Nimi and Md Yusuf Sarwar Uddin},
journal= {arXiv preprint arXiv:2203.11493},
year = {2022}
}
备注
Accepted in The 18th International Conference on Distributed Computing in Sensor Systems (DCOSS 2022)