中文

面向 JPEG 的 CNN:计算代价研究

计算机视觉与模式识别 2023-09-26 v2

摘要

卷积神经网络(CNNs)在过去十年取得了惊人进展,在若干计算机视觉任务中定义了最先进水平。CNN 能够从 RGB 像素直接学习数据的鲁棒表示。然而,大多数图像数据通常以压缩格式可用,其中 JPEG 由于传输与存储需求而最为广泛使用,需要进行初步解码过程,该过程具有高计算负载与内存占用。因此,能够直接从压缩域学习的深度学习方法近年来受到关注。这些方法通常通过部分解码提取图像的频域表示(如 DCT),然后对典型 CNN 架构进行调整以处理之。当前这些工作的一个局限是,为适应频域数据,对原始模型所做的修改显著增加了参数量与计算复杂度。一方面,方法具有更快的预处理,因为避免了完全解码图像的开销,但另一方面,图像通过模型的成本增加,削弱了加速方法的可能收益。本文中,我们进一步研究为频域设计的深度模型的计算代价,评估解码与图像通过网络的代价。我们还提出手工设计与数据驱动的技术,以降低这些模型的计算复杂度与参数数量,使其与 RGB 基线相近,从而得到在计算代价与精度间具有更优权衡的高效模型。

关键词

引用

@article{arxiv.2309.11417,
  title  = {CNNs for JPEGs: A Study in Computational Cost},
  author = {Samuel Felipe dos Santos and Nicu Sebe and Jurandy Almeida},
  journal= {arXiv preprint arXiv:2309.11417},
  year   = {2023}
}

备注

A previous version of this work had already been submitted to ArXiv and is available at arXiv:2012.14426. Instead of maintaining two different submissions, we decided to submit a replacement for the previous submission