文本到图像模型的最佳提示及其寻找方法
人机交互
2023-06-05 v3 计算与语言
计算机视觉与模式识别
摘要
生成模型尤其是文本引导扩散模型的最新进展,使得生成类似专业人类艺术家作品、具有美学吸引力的图像成为可能。然而,必须仔细撰写称为提示(prompt)的文本描述,并辅以一组澄清性关键词。由于美学难以通过计算评估,需要人类反馈来确定最优的提示表述与关键词组合。本文提出一种人在回路的方法,利用遗传算法学习最有用的提示关键词组合。我们还展示了该方法如何提升描绘相同描述的图像的美学吸引力。
引用
@article{arxiv.2209.11711,
title = {Best Prompts for Text-to-Image Models and How to Find Them},
author = {Nikita Pavlichenko and Dmitry Ustalov},
journal= {arXiv preprint arXiv:2209.11711},
year = {2023}
}
备注
13 pages (6 main pages), 7 figures, 4 tables, accepted at SIGIR '23 Short Paper Track