中文

面向新手的文本到图像合成:基于多轮引导的用户中心化提示生成

人工智能 2025-10-15 v2

摘要

文本到图像合成 (text-to-image synthesis, TIS) 模型的出现显著影响了数字图像创建,通过从文字描述生成高质量视觉内容。然而,这些模型对文本提示敏感,给不熟悉 TIS 提示编写的初学者用户带来了挑战。现有解决方案通过自动提示扩展或从用户查询生成提示来缓解这一问题,但这种单轮方式在结果可解释性和用户交互性方面受限。因此,我们提出了 DialPrompt,一种面向初学者用户的对话式 TIS 提示生成模型,强调用户体验。DialPrompt 设计为多轮对话流程,在每一轮对话中,模型引导用户表达对可能优化维度的偏好,然后生成最终的 TIS 提示。为实现这一目标,我们从高级用户中挖掘了 15 个高质量提示的关键维度,并构建了多轮数据集。通过在该数据集上训练,DialPrompt 通过允许用户感知和控制 TIS 提示的创建过程来提高用户中心化程度。实验表明,DialPrompt 在用户中心化得分方面显著优于现有方法,同时保持竞争的图像合成质量。在人类评估中,DialPrompt 获得了 19 位评审(尤其是初学者)的高度评价。

关键词

引用

@article{arxiv.2408.12910,
  title  = {Taming Text-to-Image Synthesis for Novices: User-centric Prompt Generation via Multi-turn Guidance},
  author = {Yilun Liu and Minggui He and Feiyu Yao and Yuhe Ji and Shimin Tao and Jingzhou Du and Duan Li and Jian Gao and Li Zhang and Hao Yang and Boxing Chen and Osamu Yoshie},
  journal= {arXiv preprint arXiv:2408.12910},
  year   = {2025}
}

备注

Accepted by EMNLP 2025 main