中文

学习为文本到图像生成采样有效且多样的提示词

计算机视觉与模式识别 2025-02-18 v1

摘要

近期的文本到图像扩散模型取得了令人印象深刻的图像生成能力。然而,要控制具有所需属性(例如审美质量、用户意图)的生成过程仍具有挑战性,这些属性可表示为黑箱奖励函数。本文聚焦于提示词适应,即将原始提示词细化为模型偏好的提示词以生成所需图像。虽然先前工作使用强化学习(RL)来优化提示词,但我们注意到应用RL通常会导致生成类似的后缀和确定性行为。为此,我们提出了基于GFlowNets的提示词适应框架(PAG),将提示词适应建模为概率推断问题。我们的关键洞察是,利用生成式流网络(GFlowNets)可使我们从奖励最大化转向从未归一化密度函数进行抽样,从而实现高质量且多样的提示词生成。然而,我们发现,朴素应用GFlowNets会出现模式坍缩,并揭示了一种被忽视的现象:模型在神经可塑性方面的逐渐丧失,这种现象因顺序提示生成中的信用分配效率低下而加剧。为解决这一关键挑战,我们在PAG中开发了一套系统方法,包括流动重新激活、奖励优先抽样和奖励分解用于提示词适应。广泛的实验验证了PAG成功地学习了如何为文本到图像生成采样有效且多样的提示词。我们还展示了PAG在各种奖励函数下表现出强大的鲁棒性,并能可移植到不同的文本到图像模型。

关键词

引用

@article{arxiv.2502.11477,
  title  = {Learning to Sample Effective and Diverse Prompts for Text-to-Image Generation},
  author = {Taeyoung Yun and Dinghuai Zhang and Jinkyoo Park and Ling Pan},
  journal= {arXiv preprint arXiv:2502.11477},
  year   = {2025}
}

备注

18 pages, 14 figures, 6 tables