利用扩散模型实现可控训练数据生成
计算机视觉与模式识别
2025-05-20 v2 计算与语言
机器学习
摘要
我们提出了一种控制文本到图像生成模型以产生对监督学习有用的训练数据的方法。与先前采用开环方法并预定义提示词、利用语言模型或人类专业知识生成新数据的工作不同,我们开发了一个包含两种反馈机制的自动化闭环系统。第一种机制利用给定监督模型的反馈,寻找能导致图像生成结果最大化模型损失的对抗性提示词。虽然这些对抗性提示词能产生由模型信息指导的多样化数据,但它们未受目标分布的信息指导,这可能效率低下。因此,我们引入了第二种反馈机制,将生成过程导向特定的目标分布。我们将结合这两种机制的方法称为引导式对抗性提示(Guided Adversarial Prompts)。我们在不同任务、数据集和架构上,针对不同类型的分布偏移(虚假相关数据、未见过的领域)进行评估,并证明了所提出的反馈机制相较于开环方法的效率。
引用
@article{arxiv.2403.15309,
title = {Controlled Training Data Generation with Diffusion Models},
author = {Teresa Yeo and Andrei Atanov and Harold Benoit and Aleksandr Alekseev and Ruchira Ray and Pooya Esmaeil Akhoondi and Amir Zamir},
journal= {arXiv preprint arXiv:2403.15309},
year = {2025}
}
备注
Project page at https://adversarial-prompts.epfl.ch/