DRAGON:基于扩散模型生成的大规模真实图像数据集
计算机视觉与模式识别
2025-05-19 v1 机器学习
摘要
扩散模型生成图像的使用便利性已导致合成内容在网络上激增。尽管这些模型常被用于合法目的,但也被用于生成支持虚假信息和仇恨言论的图像。因此,及时开发能够检测图像是否由此类模型生成的鲁棒工具至关重要。许多现有检测方法需要大量样本图像进行训练。不幸的是,由于该领域的快速发展,现有数据集仅覆盖有限范围的模型,迅速过时。在本工作中,我们引入 DRAGON 数据集,包含来自 25 个扩散模型的图像,涵盖最新进展及经典架构。数据集包含多样化的图像主题。为提升图像真实性,我们提出一种简单有效的流程,利用大语言模型扩展输入提示,从而生成更具多样性和更高质量的输出,证实在标准质量指标上取得改进。数据集提供多个规模(从超小型到超大型),以适应不同研究场景。DRAGON 旨在支持 Forensic 社区发展和评估用于综合内容检测与归因的技术。此外,数据集附带专用测试集,用作评估新方法性能的基准。
引用
@article{arxiv.2505.11257,
title = {DRAGON: A Large-Scale Dataset of Realistic Images Generated by Diffusion Models},
author = {Giulia Bertazzini and Daniele Baracchi and Dasara Shullani and Isao Echizen and Alessandro Piva},
journal= {arXiv preprint arXiv:2505.11257},
year = {2025}
}