中文

文本到图像模型的最佳提示及其寻找方法

人机交互 2023-06-05 v3 计算与语言 计算机视觉与模式识别

摘要

生成模型尤其是文本引导扩散模型的最新进展,使得生成类似专业人类艺术家作品、具有美学吸引力的图像成为可能。然而,必须仔细撰写称为提示(prompt)的文本描述,并辅以一组澄清性关键词。由于美学难以通过计算评估,需要人类反馈来确定最优的提示表述与关键词组合。本文提出一种人在回路的方法,利用遗传算法学习最有用的提示关键词组合。我们还展示了该方法如何提升描绘相同描述的图像的美学吸引力。

关键词

引用

@article{arxiv.2209.11711,
  title  = {Best Prompts for Text-to-Image Models and How to Find Them},
  author = {Nikita Pavlichenko and Dmitry Ustalov},
  journal= {arXiv preprint arXiv:2209.11711},
  year   = {2023}
}

备注

13 pages (6 main pages), 7 figures, 4 tables, accepted at SIGIR '23 Short Paper Track