基于扩散模型从纯文本故事零样本生成连贯绘本
计算机视觉与模式识别
2023-02-09 v1 人工智能
机器学习
机器学习
摘要
大规模文本到图像模型的最新进展为人类通过自然语言引导图像创作开辟了新的可能。然而,尽管先前文献主要关注单张图像生成,考虑这些模型在图像序列中保持连贯性的能力以满足如讲故事等现实应用的需求至关重要。为此,我们提出了一种从故事纯文本生成连贯绘本的新型神经流水线。具体而言,我们利用预训练大语言模型与文本引导的潜在扩散模型相结合来生成连贯图像。先前的故事合成框架通常需要训练于昂贵图像-描述对的大规模文本到图像模型以维持连贯性,而我们采用简单的文本反演技术以及基于检测器的语义图像编辑,从而实现连贯绘本的零样本生成。实验结果表明,我们提出的方法优于最先进的图像编辑基线。
引用
@article{arxiv.2302.03900,
title = {Zero-shot Generation of Coherent Storybook from Plain Text Story using Diffusion Models},
author = {Hyeonho Jeong and Gihyun Kwon and Jong Chul Ye},
journal= {arXiv preprint arXiv:2302.03900},
year = {2023}
}