大规模生成模型会污染未来数据集吗?
计算机视觉与模式识别
2023-08-11 v2
摘要
最近提出的大规模文本到图像生成模型,如 DALL·E 2、Midjourney 和 StableDiffusion,可以根据用户的提示生成高质量且逼真的图像。不仅限于研究界,普通互联网用户也在使用这些生成模型,因此大量生成图像已在互联网上分享。与此同时,当今深度学习在计算机视觉领域的成功很大程度上归功于从互联网收集的图像。这些趋势引出了一个研究问题:“此类生成图像会正面还是负面地影响未来数据集的质量和计算机视觉模型的性能?”本文通过模拟污染来实证回答这个问题。即,我们使用最先进的生成模型生成 ImageNet 规模和 COCO 规模的数据集,并在包括图像分类和图像生成在内的各种任务上评估用“污染”数据集训练的模型。通过实验,我们得出结论:生成图像对下游性能产生负面影响,而其显著性取决于任务和生成图像的数量。生成的数据集和实验代码将公开以供未来研究。生成的数据集和源代码可从 \url{https://github.com/moskomule/dataset-contamination} 获取。
引用
@article{arxiv.2211.08095,
title = {Will Large-scale Generative Models Corrupt Future Datasets?},
author = {Ryuichiro Hataya and Han Bao and Hiromi Arai},
journal= {arXiv preprint arXiv:2211.08095},
year = {2023}
}
备注
ICCV 2023