对人类而言无法区分的图像,对分类器而言也无法区分吗?
计算机视觉与模式识别
2025-03-25 v4 机器学习
摘要
生成模型的最终目标是完美地捕捉数据分布。对于图像生成而言,常见的视觉质量指标(如FID)和生成图像感知上的真实性似乎表明我们正接近这一目标。然而,通过分布分类任务,我们揭示出,从基于神经网络的分类器的角度来看,即使是先进的扩散模型也远未达到这一目标。具体来说,分类器能够在各种设置下持续且轻松地区分真实图像与生成图像。此外,我们发现了一个有趣的差异:分类器可以轻易区分性能相当的扩散模型(例如U-ViT-H与DiT-XL),但在区分同一系列但不同规模的模型(例如EDM2-XS与EDM2-XXL)时却存在困难。我们的方法具有若干重要启示。首先,通过分析生成数据的特定特征,它自然可以作为扩散模型的诊断工具。其次,它揭示了模型自噬障碍,并为生成数据的使用提供了见解:用生成数据增强真实数据比替换真实数据更有效。第三,分类器引导可以显著提升生成图像的真实感。
引用
@article{arxiv.2405.18029,
title = {Are Images Indistinguishable to Humans Also Indistinguishable to Classifiers?},
author = {Zebin You and Xinyu Zhang and Hanzhong Guo and Jingdong Wang and Chongxuan Li},
journal= {arXiv preprint arXiv:2405.18029},
year = {2025}
}
备注
Accepted to CVPR 2025