合成图像用于模型训练的缩放定律……目前而言
计算机视觉与模式识别
2023-12-08 v1
摘要
近期文本到图像模型的重大进展开启了使用合成图像训练视觉系统的可能性,这有望克服大规模收集高质量数据的困难。然而,当训练集中加入更多合成数据时,这些模型在大规模下的表现尚不明确。本文研究了由最先进的文本到图像模型生成的合成图像,在训练监督模型(带标签监督的图像分类器)和CLIP(带语言监督)时的缩放定律。我们识别出几个显著影响缩放行为的因素,包括文本提示、无分类器引导尺度以及文本到图像模型的类型。在调整这些因素后,我们观察到,在CLIP训练中,合成图像展现出与真实图像相似但效果稍逊的缩放趋势,而在训练监督图像分类器时,其缩放性能显著不佳。我们的分析表明,这种性能不佳的主要原因是现成的文本到图像模型无法生成某些概念,这一限制严重损害了图像分类器的训练。我们的发现还表明,在以下场景中,缩放合成数据可能特别有效:(1)当监督问题的真实图像供应有限时(例如,ImageNet中少于50万张图像),(2)当评估数据集与训练数据显著偏离时,即分布外场景,或(3)当合成数据与真实图像结合使用时,如CLIP模型的训练所示。
引用
@article{arxiv.2312.04567,
title = {Scaling Laws of Synthetic Images for Model Training ... for Now},
author = {Lijie Fan and Kaifeng Chen and Dilip Krishnan and Dina Katabi and Phillip Isola and Yonglong Tian},
journal= {arXiv preprint arXiv:2312.04567},
year = {2023}
}