中文

面向图像分类的语义引导扩散模型生成式图像增强方法

计算机视觉与模式识别 2024-01-19 v3 机器学习

摘要

现有图像增强方法分为两类:基于扰动的方法和生成式方法。基于扰动的方法通过施加预定义扰动来增强原始图像,但仅局部改变图像,因而缺乏图像多样性。相比之下,生成式方法能带来更强的图像多样性,但可能无法保持语义一致性,从而错误地改变原始图像的基本语义。为平衡增强图像的多样性与语义一致性,我们提出 SGID,一种面向图像分类的语义引导扩散模型生成式图像增强方法。具体而言,SGID 利用扩散模型生成具有良好多样性的增强图像。更重要的是,SGID 以图像标签和文本描述作为引导,以维持增强图像与原始图像之间的语义一致性。实验结果表明,SGID 在 ResNet-50(从头训练)上比最佳增强基线高出 1.72%,在 ViT(ImageNet-21k)上高出 0.33%,在 CLIP-ViT(LAION-2B)上高出 0.14%。此外,SGID 可与其他图像增强基线方法结合,进一步提升整体性能。我们通过定量的人工评估与自动评估以及定性的案例研究,展示了 SGID 的语义一致性和图像多样性。

关键词

引用

@article{arxiv.2302.02070,
  title  = {Semantic-Guided Generative Image Augmentation Method with Diffusion Models for Image Classification},
  author = {Bohan Li and Xiao Xu and Xinghao Wang and Yutai Hou and Yunlong Feng and Feng Wang and Xuanliang Zhang and Qingfu Zhu and Wanxiang Che},
  journal= {arXiv preprint arXiv:2302.02070},
  year   = {2024}
}

备注

AAAI 2024