JPEG压缩下的CNN训练:多媒体取证与计算机视觉的比较
计算机视觉与模式识别
2020-09-28 v1 机器学习
多媒体
图像与视频处理
摘要
卷积神经网络(CNNs)已在多项过去需视觉检视的计算机视觉图像分类任务中证明极为准确(如物体识别、人脸检测等)。受这些惊人结果启发,研究者也开始使用CNN应对图像取证问题(如相机模型辨识、篡改检测等)。然而,在计算机视觉中,图像分类方法通常依赖人眼易察觉的视觉线索。相反,取证方案依赖几乎不可见、且常极为细微并位于待分析图像精细细节中的痕迹。因此,训练CNN解决取证任务需特别留意,因为常见处理操作(如重采样、压缩等)会强烈妨碍取证痕迹。本工作中,我们聚焦于JPEG对不同计算机视觉与取证图像分类问题下CNN训练的影响。具体地,我们考虑由JPEG压缩与JPEG网格错位所引起的问题。我们表明,为恰当训练不失泛化能力的取证检测器,生成训练数据集时必须考虑这些效应,而对于计算机视觉任务则几乎可忽略这些效应。
引用
@article{arxiv.2009.12088,
title = {Training CNNs in Presence of JPEG Compression: Multimedia Forensics vs Computer Vision},
author = {Sara Mandelli and Nicolò Bonettini and Paolo Bestagini and Stefano Tubaro},
journal= {arXiv preprint arXiv:2009.12088},
year = {2020}
}