中文

视频分析准确率为何波动,以及我们如何应对?

计算机视觉与模式识别 2022-09-19 v2 机器学习

摘要

将视频视为图像(帧)序列,并复用仅在图像上训练的深度神经网络模型来处理视频上的类似分析任务,是一种常见做法。本文表明,这种认为在图像上表现良好的深度学习模型在视频上同样表现良好的想当然假设实际上是有缺陷的。我们证明,即便视频监控的场景未以任何人类可感知的方式发生变化,且我们控制了视频压缩和环境(光照)等外部因素,视频分析应用的准确率仍会出现明显波动。这些波动之所以发生,是因为视频摄像机产生的连续帧在视觉上可能相似,却被视频分析应用以颇为不同的方式感知。我们观察到,这些波动的根本原因是视频摄像机为捕捉并生成视觉悦目的视频而自动进行的动态相机参数调整。相机无意中充当了非蓄意的对抗者,因为如我们所展示的,连续帧中图像像素值的细微变化对复用图像训练深度学习模型的视频分析任务洞察准确率具有明显的不利影响。为应对相机这种非蓄意的对抗效应,我们探索使用迁移学习技术,通过从图像分析任务学习中迁移知识来改进视频分析任务的学习。具体而言,我们展示了新训练的Yolov5模型降低了跨帧目标检测的波动,从而带来更好的目标跟踪(跟踪错误减少40%)。本文还为缓解相机对视频分析应用所用深度学习模型的对抗效应提供了新方向与技术。

关键词

引用

@article{arxiv.2208.12644,
  title  = {Why is the video analytics accuracy fluctuating, and what can we do about it?},
  author = {Sibendu Paul and Kunal Rao and Giuseppe Coviello and Murugan Sankaradas and Oliver Po and Y. Charlie Hu and Srimat Chakradhar},
  journal= {arXiv preprint arXiv:2208.12644},
  year   = {2022}
}