中文

合成训练图像未兑现的承诺:使用检索到的真实图像表现更好

计算机视觉与模式识别 2025-01-03 v5

摘要

生成式文本到图像模型使我们能够以可控的方式合成无限量的图像,这促使近期许多工作使用合成数据训练视觉模型。然而,每个合成图像最终都源自用于训练生成器的上游数据。中间生成器是否提供了比直接训练上游数据相关部分更多的信息?我们将此问题置于图像分类的背景下,比较了在由Stable Diffusion(一个在LAION-2B数据集上训练的生成模型)生成的与任务相关的、有针对性的合成数据上进行微调,与在直接从LAION-2B检索到的有针对性的真实图像上进行微调。我们表明,虽然合成数据可以使某些下游任务受益,但它普遍被简单检索基线的真实数据匹配或超越。我们的分析表明,这种性能不足部分是由于合成图像中的生成器伪影和不准确的任务相关视觉细节。总体而言,我们认为,在使用合成数据进行训练时,有针对性的检索是一个需要考虑的关键基线——当前方法尚未超越的基线。我们在https://github.com/scottgeng00/unmet-promise发布代码、数据和模型。

关键词

引用

@article{arxiv.2406.05184,
  title  = {The Unmet Promise of Synthetic Training Images: Using Retrieved Real Images Performs Better},
  author = {Scott Geng and Cheng-Yu Hsieh and Vivek Ramanujan and Matthew Wallingford and Chun-Liang Li and Pang Wei Koh and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2406.05184},
  year   = {2025}
}

备注

Correspondence to sgeng at cs dot washington dot edu. RK and PWK equally advised the project