中文

PromptCharm: 通过多模态提示和细化实现文本到图像生成

人机交互 2024-03-08 v1 人工智能

摘要

近期生成式 AI 的快速发展显著推动了文本到图像生成领域。目前最先进的文本到图像模型 Stable Diffusion 能够合成具有强烈审美感的高质量图像,因此,精心构思与模型解释和用户意图一致的文本提示变得至关重要。然而,对于新手用户来说,提示工作仍然具有挑战性,主要因为稳定扩散模型的复杂性以及迭代编辑和细化文本提示所需的不寻常 effort。为解决这些挑战,我们提出了 PromptCharm,一种混合主动系统,通过多模态提示工程和细化来促进文本到图像创建。为帮助新手用户进行提示,PromptCharm 首先自动细化和优化用户的初始提示。此外,PromptCharm 支持用户在大型数据库中探索和选择不同的图像风格。为帮助用户有效地细化其提示和图像,PromptCharm 通过可视化模型注意力值来呈现模型解释。如果用户注意到生成图像中不满意的区域,可以通过模型注意力调整或图像 inpainting 进一步细化图像。为评估 PromptCharm 的有效性和可用性,我们进行了 12 名参与者的受控用户研究和另外 12 名参与者的探索性用户研究。这两个研究表明,使用 PromptCharm 的参与者能够创建出更高质量且更符合用户期望的图像,与使用缺少交互或可视化支持的 PromptCharm 变体相比。

关键词

引用

@article{arxiv.2403.04014,
  title  = {PromptCharm: Text-to-Image Generation through Multi-modal Prompting and Refinement},
  author = {Zhijie Wang and Yuheng Huang and Da Song and Lei Ma and Tianyi Zhang},
  journal= {arXiv preprint arXiv:2403.04014},
  year   = {2024}
}

备注

To appear in the 2024 CHI Conference on Human Factors in Computing Systems (CHI '24), May 11--16, 2024, Honolulu, HI, USA