Swin Transformer 在 CGI 图像检测中的鲁棒性:基于多个颜色空间的内部和跨数据集分析
计算机视觉与模式识别
2025-05-23 v1
摘要
本研究旨在解决日益增长的挑战,即在三种不同颜色空间 (RGB、YCbCr、HSV) 中区分计算机生成图像 (CGI) 和真实数字图像。鉴于现有分类方法在处理 CGI 的复杂性和变异性方面的局限性,本研究提出一种基于 Swin Transformer 的模型,用于准确区分自然图像和合成图像。该模型利用 Swin Transformer 的层次结构捕获自然图像与 CGI 图像的局部和全局特征。通过在三个数据集 (CiFAKE、JSSSTU 和 Columbia) 上的内部和跨数据集测试评估了该方法的性能。该模型分别在每个数据集 (D1、D2、D3) 上进行评估,并在组合数据集 (D1+D2+D3) 上进行评估,以测试其鲁棒性和域泛化能力。为解决数据集不平衡问题,应用了数据增强技术。此外,使用 t-SNE 可视化技术展示了 Swin Transformer 在所选颜色空间中实现的特征可分性。该模型在所有颜色方案上进行了测试,其中 RGB 颜色方案在每个数据集上获得最高准确率。因此,选取 RGB 用于域泛化分析,并与其他基于 CNN 的模型 (VGG-19 和 ResNet-50) 进行比较。比较结果表明,所提模型在 CGI 检测中有效,显示出在内部数据集和跨数据集评估中的卓越鲁棒性和可靠性。本研究的发现凸显了 Swin Transformer 模型作为数字图像 forensics 工具的潜力,尤其是在区分 CGI 和自然图像方面。该模型的卓越性能表明其具备域泛化能力,在需要精确可靠图像分类的场景中具有重要价值。
引用
@article{arxiv.2505.16253,
title = {Swin Transformer for Robust CGI Images Detection: Intra- and Inter-Dataset Analysis across Multiple Color Spaces},
author = {Preeti Mehta and Aman Sagar and Suchi Kumari},
journal= {arXiv preprint arXiv:2505.16253},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2409.04734