中文

固定阈值评估:跨照片与艺术品的混合CNN-ViT用于AI生成图像检测

计算机视觉与模式识别 2025-12-29 v1

摘要

AI图像生成器会创建两类图像:既有逼真的照片,也有风格化的艺术品,因而需要保持性能稳健的检测器,以应对常见的后处理转换(JPEG压缩、模糊、降采样)。现有方法针对单个指标进行优化,而未解决部署关键因素,如 operating point 选择和固定阈值鲁棒性问题。本工作通过引入固定阈值评估协议来解决误导性鲁棒性估计问题:该协议在干净验证数据上选择一次决策阈值,然后固定在所有后处理转换下。传统方法会针对每种条件重新调整阈值,从而人为夸大鲁棒性估计,并掩盖部署中的实际失效。我们在三个 operating points(低FPR、ROC最优、最佳F1)下,针对系统化退化测试报告部署相关性能,使用轻量级CNN-ViT混合架构配合门控融合和可选频率增强。我们的评估揭示了经统计学验证的forensic-语义谱:频率辅助CNN在原版照片上表现优异,但在压缩后性能下降(从93.33%下降至61.49%),而ViT通过稳健的语义模式识别几乎不受影响(从92.86%下降至88.36%)。多随机实验表明,所有架构在艺术内容(AUROC 0.901-0.907)上的表现明显优于照片逼真图像(AUROC 0.747-0.759),确认语义模式比forensic痕迹提供了更可靠的检测线索。我们的混合方法实现了跨域的均衡性能:在tiny-genimage照片上达91.4%准确率,在AiArtData艺术/图形上达89.7%准确率,在CIFAKE上达98.3%(具竞争力)。固定阈值评估消除了重新调整的人为夸大,揭示了真实的鲁棒性差距,并为实际部署提供了可操作的指导:干净照片验证优先选择CNN,压缩内容优先选择ViT,艺术/图形筛查可选混合架构。

关键词

引用

@article{arxiv.2512.21512,
  title  = {Fixed-Threshold Evaluation of a Hybrid CNN-ViT for AI-Generated Image Detection Across Photos and Art},
  author = {Md Ashik Khan and Arafat Alam Jion},
  journal= {arXiv preprint arXiv:2512.21512},
  year   = {2025}
}

备注

Accepted at the 2025 28th International Conference on Computer and Information Technology (ICCIT). 6 pages, 5 figures