中文

DIAGen:用于少样本学习的语义多样化图像增强生成模型

计算机视觉与模式识别 2025-05-27 v2 人工智能

摘要

简单的数据增强技术,如旋转和翻转,广泛用于增强计算机视觉模型的泛化能力。然而,这些技术往往难以修改类别的高层次语义属性。为此,研究人员探索了生成式数据增强方法,如最近提出的 DA-Fusion。尽管取得了一些进展,但这些变体仍主要局限于纹理变化,难以涵盖视角、环境、天气条件或甚至类别级语义属性(例如,狗的品种变化)。为此,我们提出了 DIAGen,基于 DA-Fusion 构建。首先,我们对使用文本逆变学习的对象嵌入施加高斯噪声,以利用预训练扩散模型的知识多样化生成。其次,我们利用文本到文本生成模型的通用知识,指导扩散模型以变体类别特定提示进行图像生成。最后,我们引入一种加权机制以缓解 poorly 生成样本的影响。跨多个数据集的实验结果表明,DIAGen 不仅提升了语义多样性,还提高了后续分类器的性能。DIAGen 相对于标准增强和 DA-Fusion 基线的优势在面对离群点样本时尤为显著。

关键词

引用

@article{arxiv.2408.14584,
  title  = {DIAGen: Semantically Diverse Image Augmentation with Generative Models for Few-Shot Learning},
  author = {Tobias Lingenberg and Markus Reuter and Gopika Sudhakaran and Dominik Gojny and Stefan Roth and Simone Schaub-Meyer},
  journal= {arXiv preprint arXiv:2408.14584},
  year   = {2025}
}

备注

Published in GCPR 2024