探索闭合集合生成式数据增强与真实数据增强在图像分类中的等价性
计算机视觉与模式识别
2025-08-14 v1
摘要
本文我们针对机器学习中的一个关键科学问题:给定用于图像分类任务的训练集,我们可以在该数据集上训练生成模型以提高分类性能吗?(即闭合集合生成式数据增强)。我们首先通过实验探讨了真实图像与由先进生成模型生成的闭合集合合成图像之间的区别和相似之处。通过大量实验,我们为有效利用闭合集合合成数据进行增强提供了系统性见解。值得注意的是,我们经验性地确定了实现增强效果所需的合成图像等效规模。此外,我们还显示了真实数据增强与开放集合生成式增强(使用超出给定训练集数据的训练数据的生成模型)之间存在定量等价性。虽然这符合普遍直觉——即真实图像通常被优先考虑——但我们的实证公式也为量化实现相当图像分类性能所需的合成数据增强规模提供了指南。我们的结果在自然图像和医学图像数据集上进一步说明了这一效应如何随基线训练集大小和所纳入的合成数据量而变化。
引用
@article{arxiv.2508.09550,
title = {Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification},
author = {Haowen Wang and Guowei Zhang and Xiang Zhang and Zeyuan Chen and Haiyang Xu and Dou Hoon Kwark and Zhuowen Tu},
journal= {arXiv preprint arXiv:2508.09550},
year = {2025}
}