面向抽象概念理解的文本到图像扩散模型的提示优化器
计算机视觉与模式识别
2024-04-18 v1 人工智能
机器学习
摘要
文本到图像扩散模型的快速发展开启了生成式AI的大门,使得将文本描述转化为视觉上引人注目的图像成为可能,且质量卓越。然而,该领域的一个持续挑战是优化提示以有效地将抽象概念转化为具体对象。例如,文本编码器很难表达“和平”,但可以轻松描绘橄榄枝和白鸽。本文提出了一种名为抽象概念提示优化器(POAC)的新方法,专门设计用于增强文本到图像扩散模型在解释和生成抽象概念图像方面的性能。我们提出了一个提示语言模型(PLM),它从预训练语言模型初始化,然后使用精心策划的抽象概念提示数据集进行微调。该数据集使用GPT-4创建,将抽象概念扩展为场景和具体对象。我们的框架采用基于强化学习(RL)的优化策略,专注于稳定扩散模型生成的图像与优化提示之间的对齐。通过大量实验,我们证明所提出的POAC显著提高了生成图像的准确性和美学质量,特别是在抽象概念的描述和与优化提示的对齐方面。我们还提供了模型在不同设置下跨扩散模型性能的全面分析,展示了其在增强抽象概念表示方面的多功能性和有效性。
引用
@article{arxiv.2404.11589,
title = {Prompt Optimizer of Text-to-Image Diffusion Models for Abstract Concept Understanding},
author = {Zezhong Fan and Xiaohan Li and Chenhao Fang and Topojoy Biswas and Kaushiki Nag and Jianpeng Xu and Kannan Achan},
journal= {arXiv preprint arXiv:2404.11589},
year = {2024}
}
备注
WWW 2024 Companion