优化文本到图像生成的提示
计算与语言
2024-01-01 v2 计算机视觉与模式识别
摘要
精心设计的提示可以引导文本到图像模型生成令人惊叹的图像。然而,性能优异的提示通常是模型特定的,并且与用户输入不一致。我们提出了一种提示自适应框架,该框架能自动将原始用户输入适配为模型偏好的提示,从而替代了费力的人工工程。具体来说,我们首先在一个小型人工设计提示集合上,使用预训练语言模型进行监督微调。然后,我们使用强化学习来探索更好的提示。我们定义了一个奖励函数,鼓励策略生成更具美学吸引力的图像,同时保留原始用户意图。在Stable Diffusion上的实验结果表明,我们的方法在自动指标和人类偏好评分方面均优于人工提示工程。此外,强化学习进一步提升了性能,尤其是在域外提示上。预训练检查点可在https://aka.ms/promptist获取。演示可在https://aka.ms/promptist-demo找到。
引用
@article{arxiv.2212.09611,
title = {Optimizing Prompts for Text-to-Image Generation},
author = {Yaru Hao and Zewen Chi and Li Dong and Furu Wei},
journal= {arXiv preprint arXiv:2212.09611},
year = {2024}
}
备注
Accepted by NeurIPS-23