中文

多样化而非微调:利用合成图像扩展视觉识别训练

计算机视觉与模式识别 2025-01-22 v2 人工智能 机器学习

摘要

生成式深度学习的最新进展使得在文本到图像生成中创建高质量合成图像成为可能。先前的工作表明,在 ImageNet 上微调预训练扩散模型并从微调后的模型生成合成训练图像可以增强 ImageNet 分类器的性能。然而,随着合成图像数量超过真实图像,性能会下降。在本文中,我们探讨了生成式微调对于这种改进是否必要,以及是否可以使用更多合成数据进一步扩展训练。我们提出了一个新框架,利用现成的生成模型来生成合成训练图像,解决了多个挑战:类名歧义、朴素提示缺乏多样性以及域偏移。具体而言,我们利用大语言模型(LLM)和 CLIP 来解决类名歧义。为了使图像多样化,我们提出了由 LLM 提示的情境化多样化和风格化多样化方法。最后,为了缓解域偏移,我们利用了带有合成图像辅助批归一化的域适应技术。我们的框架随着合成数据的增多持续提升识别模型的性能,最高达到原始 ImageNet 规模的 6 倍,展示了合成数据在改进识别模型和实现强大的域外泛化方面的潜力。

关键词

引用

@article{arxiv.2312.02253,
  title  = {Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images},
  author = {Zhuoran Yu and Chenchen Zhu and Sean Culatana and Raghuraman Krishnamoorthi and Fanyi Xiao and Yong Jae Lee},
  journal= {arXiv preprint arXiv:2312.02253},
  year   = {2025}
}

备注

Accepted by Transactions on Machine Learning Research (TMLR)