D$^3$QE: 离散分布不确定性量化误差学习用于自回归生成图像检测
计算机视觉与模式识别
2025-10-08 v1 人工智能
摘要
视觉自回归 (AR) 模型的出现 revolutionized 了图像生成,同时为合成图像检测带来了新挑战。与之前的 GAN 或扩散方法不同,AR 模型通过离散 token 预测生成图像,既在图像合成质量上取得显著提升,又在向量量化表示上呈现出独特特征。本文提出利用离散分布不确定性量化误差 (DQE) 进行自回归生成图像检测,该方法利用 real 和 fake 图像中 codebook 存在的独特模式和频率分布偏差。我们引入一种离散分布不确定性感知的变换器,将动态 codebook 频率统计融入注意力机制,将语义特征和量化误差潜在融合。为评估该方法,我们构建了一个覆盖 7 个主流视觉 AR 模型的综合数据集,称为 ARForensics。实验表明,DQE 在不同 AR 模型之间展现出卓越的检测准确率和强大的泛化能力,同时对 real-world扰动具有鲁棒性。代码已公开于 \href{https://github.com/Zhangyr2022/D3QE}{https://github.com/Zhangyr2022/D3QE}。
引用
@article{arxiv.2510.05891,
title = {$\bf{D^3}$QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection},
author = {Yanran Zhang and Bingyao Yu and Yu Zheng and Wenzhao Zheng and Yueqi Duan and Lei Chen and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2510.05891},
year = {2025}
}
备注
10 pages, 5 figures, published to ICCV2025