Mini-DALLE3:通过提示大语言模型实现交互式文本到图像生成
人工智能
2023-10-16 v2
摘要
人工智能内容生成的变革随着文本到图像(T2I)扩散模型的蓬勃发展而迅速加速。在仅两年的发展中,最先进模型所能生成的内容在质量、多样性和创造性上达到了前所未有的高度。然而,使用自然语言描述与这些流行的 T2I 模型(如 Stable Diffusion)进行有效沟通这一普遍局限依然存在。这通常使得在没有提示工程专业知识(涉及复杂词语组合、魔法标签和标注)的情况下难以获得引人入胜的图像。受近期发布的 DALLE3(一种直接内置于 ChatGPT 中、能理解人类语言的 T2I 模型)启发,我们重新审视现有 T2I 系统以努力对齐人类意图,并引入一项新任务——交互式文本到图像(iT2I),其中人们可以利用自然语言与 LLM 交互,进行交错的高质量图像生成/编辑/优化以及问答,并具有更强的图像与文本对应性。为解决 iT2I 问题,我们提出了一种简单方法,通过提示技术和现成的 T2I 模型增强 LLM 的 iT2I 能力。我们在不同 LLM(如 ChatGPT、LLAMA、Baichuan 和 InternLM)下的多种常用场景中评估了我们的 iT2I 方法。我们证明,我们的方法可以作为一种便捷且低成本的方式,为任何现有 LLM 和任何文本到图像模型引入 iT2I 能力而无需任何训练,同时对 LLM 的固有能力(如问答和代码生成)带来微小退化。我们希望这项工作能引起更广泛的关注,并为提升下一代 T2I 系统的人机交互体验及图像质量提供启发。
引用
@article{arxiv.2310.07653,
title = {Mini-DALLE3: Interactive Text to Image by Prompting Large Language Models},
author = {Zeqiang Lai and Xizhou Zhu and Jifeng Dai and Yu Qiao and Wenhai Wang},
journal= {arXiv preprint arXiv:2310.07653},
year = {2023}
}
备注
Technical report. Project page at https://minidalle3.github.io/