面向少数族的文本到图像生成:通过提示优化
计算机视觉与模式识别
2025-04-07 v3 人工智能
机器学习
摘要
我们研究了使用预训练文本到图像 (T2I) 潜在扩散模型生成少数族样本的方法。少数族实例在文本条件数据分布的低密度区域。它们对于现代 T2I 生成器的各种应用(如数据增强和创意 AI)非常有价值。不幸的是,现有的预训练 T2I 扩散模型主要聚焦于高密度区域,这主要是由于引导采样器(如 CFG)的影响,而这些采样器对于高质量生成至关重要。为此,我们提出了一种新框架来抵消 T2I 扩散模型的高密度聚焦。具体而言,我们首先开发了一个在推断期间鼓励所需属性出现,同时保持用户提供提示语义内容的在线提示优化框架。随后,我们将这个通用的提示优化器定制为一个专门的求解器,通过纳入精心设计的似然目标来促进少数族特征的生成。广泛的实验表明,我们的方法在各种类型的 T2I 模型上显著增强了产生高质量少数族实例的能力,优于现有的采样器。代码已公开于 https://github.com/soobin-um/MinorityPrompt。
引用
@article{arxiv.2410.07838,
title = {Minority-Focused Text-to-Image Generation via Prompt Optimization},
author = {Soobin Um and Jong Chul Ye},
journal= {arXiv preprint arXiv:2410.07838},
year = {2025}
}
备注
CVPR 2025 (Oral), 21 pages, 10 figures