中文

文本到图像生成的动态提示优化

计算机视觉与模式识别 2024-04-08 v1 人工智能

摘要

文本到图像生成模型,特别是基于扩散模型的 Imagen 和 Stable Diffusion 等,已取得显著进展。最近,人们对文本提示的精细调校引起浓厚兴趣。用户会为文本提示中的特定单词分配权重或改变其注入时间步,以提高生成图像的质量。然而,精细控制提示的成功依赖于提示准确性以及权重和时间步的严谨选择,需大量手动干预。为此,我们提出了提示自动编辑(PAE)方法。PAE 不仅优化原始提示以用于图像生成,还采用在线强化学习策略探索每个单词的权重和注入时间步,实现动态精细控制提示。在训练期间,奖励函数鼓励模型考虑美学得分、语义一致性和用户偏好。实验结果表明,我们提出的方法有效改进原始提示,在保持语义对齐的同时生成视觉上更吸引人的图像。代码已公开于 https://github.com/Mowenyii/PAE。

关键词

引用

@article{arxiv.2404.04095,
  title  = {Dynamic Prompt Optimizing for Text-to-Image Generation},
  author = {Wenyi Mo and Tianyu Zhang and Yalong Bai and Bing Su and Ji-Rong Wen and Qing Yang},
  journal= {arXiv preprint arXiv:2404.04095},
  year   = {2024}
}

备注

Accepted to CVPR 2024