协作式生成 AI:集成 GPT-k 以高效编辑文本到图像生成
计算与语言
2023-10-31 v2
摘要
文本到图像(T2I)生成领域已在研究界与日常用户中引发显著关注。尽管 T2I 模型取得进展,用户常遇到的一个问题是需反复编辑输入提示才能获得满意图像,这耗时耗力。鉴于大规模语言模型(如 GPT-k)已展现的文本生成能力,我们探究利用此类模型改进 T2I 生成的提示编辑过程的可能性。我们进行一系列实验,比较人类与 GPT-k 的常见编辑、评估 GPT-k 在提示 T2I 中的表现,并考察可能影响该过程的因素。我们发现 GPT-k 模型更关注插入修饰语,而人类倾向于替换单词与短语(包括主体内容的变化)。实验结果表明,GPT-k 在调整修饰语上比预测主体内容的自发变化更有效。采用 GPT-k 模型建议的编辑可将剩余编辑比例降低 20-30%。
引用
@article{arxiv.2305.11317,
title = {Collaborative Generative AI: Integrating GPT-k for Efficient Editing in Text-to-Image Generation},
author = {Wanrong Zhu and Xinyi Wang and Yujie Lu and Tsu-Jui Fu and Xin Eric Wang and Miguel Eckstein and William Yang Wang},
journal= {arXiv preprint arXiv:2305.11317},
year = {2023}
}
备注
EMNLP 2023