中文

Cap2Aug:基于图像描述引导的图像到图像数据增强

计算机视觉与模式识别 2023-11-08 v2

摘要

低数据情形下的视觉识别具有挑战性且容易过拟合。为缓解此问题,已提出若干数据增强策略。然而,旋转、裁剪和翻转等标准变换提供的语义变化有限。为此,我们提出 Cap2Aug,一种基于图像到图像扩散模型、使用图像描述作为文本提示的数据增强策略。我们从有限的训练图像生成描述,并利用这些描述通过图像到图像稳定扩散模型编辑训练图像,以生成具有语义意义的增强样本。该策略生成与训练图像相似但样本间提供语义多样性的增强图像版本。我们表明,类内的变化可由描述捕获,随后通过由描述引导的图像到图像扩散模型转化以生成多样化样本。然而,由于真实图像与合成图像之间的域差距,在合成图像上的朴素学习是不够的。因此,我们采用最大均值差异(MMD)损失将合成图像与真实图像对齐,以最小化域差距。我们在少样本和长尾分类任务上评估了我们的方法,并取得了优于最先进方法的性能提升,尤其是在低数据情形下。

关键词

引用

@article{arxiv.2212.05404,
  title  = {Cap2Aug: Caption guided Image to Image data Augmentation},
  author = {Aniket Roy and Anshul Shah and Ketul Shah and Anirban Roy and Rama Chellappa},
  journal= {arXiv preprint arXiv:2212.05404},
  year   = {2023}
}