面向JPEG的CNN:计算成本研究
计算机视觉与模式识别
2023-09-26 v3
摘要
卷积神经网络(CNNs)在过去十年取得惊人进展,定义了若干计算机视觉任务的最先进水平。CNN能够从RGB像素直接学习数据的鲁棒表示。然而,大多数图像数据通常以压缩格式可用,其中JPEG因传输与存储需求而最为广泛使用,其需初步解码过程,具有高计算负载与内存占用。因此,能直接从压缩域学习的深度学习方法近年受到关注。这些方法通常通过部分解码提取图像频域表示(如DCT),再对典型CNN架构进行调整以处理之。现有工作的一处局限是:为适配频域数据,对原始模型的修改显著增加了参数量与计算复杂度。一方面,方法因免去图像完全解码成本而具备更快预处理,但另一方面,图像通过模型的成本增加,削弱了加速方法的可能收益。本文中,我们进一步研究为频域设计的深度模型的计算成本,评估解码与图像通过网络的成本。我们还提出手工与数据驱动技术,以降低这些模型的计算复杂度与参数量,使其接近其RGB基线,从而得到在计算成本与精度间有更优权衡的高效模型。
引用
@article{arxiv.2012.14426,
title = {CNNs for JPEGs: A Study in Computational Cost},
author = {Samuel Felipe dos Santos and Nicu Sebe and Jurandy Almeida},
journal= {arXiv preprint arXiv:2012.14426},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2012.13726