用于自适应文本到图像生成的提示扩展
计算机视觉与模式识别
2023-12-29 v1
摘要
文本到图像生成模型功能强大但难以使用。用户精心设计特定的提示以获得更好的图像,尽管生成的图像可能较为重复。本文提出了一种提示扩展框架,帮助用户以更少的精力生成高质量、多样化的图像。提示扩展模型以文本查询作为输入,输出一组扩展的文本提示;这些提示经过优化,使得当传递给文本到图像模型时,能够生成更具多样性的悦目图像。我们进行了一项人类评估研究,表明通过提示扩展生成的图像在美观性和多样性上均优于基线方法生成的图像。总体而言,本文提出了一种新颖且有效的方法来改善文本到图像生成的体验。
引用
@article{arxiv.2312.16720,
title = {Prompt Expansion for Adaptive Text-to-Image Generation},
author = {Siddhartha Datta and Alexander Ku and Deepak Ramachandran and Peter Anderson},
journal= {arXiv preprint arXiv:2312.16720},
year = {2023}
}