中文

BeautifulPrompt:面向文本到图像合成的自动提示工程

计算与语言 2023-11-14 v1

摘要

近年来,基于扩散的深度生成模型(如 Stable Diffusion)在文本到图像合成中展现出令人印象深刻的结果。然而,当前的文本到图像模型通常需要人工进行多轮提示工程,才能为实际应用生成令人满意的结果。我们提出了 BeautifulPrompt,一种从非常简单的原始描述生成高质量提示的深度生成模型,使基于扩散的模型能够生成更精美的图像。在我们的工作中,我们首先在低质量与高质量收集提示对上微调 BeautifulPrompt 模型。然后,为确保生成的提示能生成更精美的图像,我们进一步提出一种带视觉 AI 反馈的强化学习(Reinforcement Learning with Visual AI Feedback)技术,对模型进行微调以最大化生成提示的奖励值,其中奖励值基于 PickScore 和美学分数(Aesthetic Scores)计算。我们的结果表明,从视觉 AI 反馈中学习有望显著提升生成提示与图像的质量。我们进一步展示了将 BeautifulPrompt 集成到云原生 AI 平台中,以在云端提供更好的文本到图像生成服务。

关键词

引用

@article{arxiv.2311.06752,
  title  = {BeautifulPrompt: Towards Automatic Prompt Engineering for Text-to-Image Synthesis},
  author = {Tingfeng Cao and Chengyu Wang and Bingyan Liu and Ziheng Wu and Jinhui Zhu and Jun Huang},
  journal= {arXiv preprint arXiv:2311.06752},
  year   = {2023}
}

备注

emnlp 2023