有损图像与视频压缩对深度卷积神经网络架构性能的影响
计算机视觉与模式识别
2020-07-29 v1
摘要
广义图像理解的最新进展见证了深度卷积神经网络(CNN)在广泛的基于图像的检测、分类与预测任务中的大量使用。尽管这些方法的报告性能令人印象深刻,本研究探讨了迄今未被触及的问题:常见图像与视频压缩技术对此类深度学习架构性能的影响。以JPEG与H.264(MPEG-4 AVC)作为当代有损图像/视频压缩技术的代表性代理(其在联网图像/视频设备与基础设施中常用),我们考察了在五项离散任务上的性能影响:人体姿态估计、语义分割、目标检测、动作识别与单目深度估计。为此,本研究中我们涵盖了多种网络架构与领域,包括端到端卷积、编码器-解码器、基于区域的CNN(R-CNN)、双流以及生成对抗网络(GAN)。我们的结果显示网络性能与所施有损压缩程度之间存在非线性且非均匀的关系。值得注意的是,当JPEG质量(量化)水平低于15%、H.264恒定速率因子(CRF)低于40时,性能显著下降。然而,在预压缩图像上重新训练上述架构反而能在某些情况下恢复高达78.4%的网络性能。此外,采用编码器-解码器流程的架构与那些展现出对有损图像压缩韧性的架构之间存在相关性。输入压缩与输出任务性能之间关系的特征可用于指导未来图像/视频设备与基础设施中的设计决策。
引用
@article{arxiv.2007.14314,
title = {On the Impact of Lossy Image and Video Compression on the Performance of Deep Convolutional Neural Network Architectures},
author = {Matt Poyser and Amir Atapour-Abarghouei and Toby P. Breckon},
journal= {arXiv preprint arXiv:2007.14314},
year = {2020}
}
备注
8 pages, 21 figures, to be published in ICPR 2020 conference