中文

AI插画师:基于提示的跨模态生成将原始描述转化为图像

计算机视觉与模式识别 2022-09-09 v2

摘要

AI插画师旨在为书籍自动设计视觉上引人入胜的图像,以激发丰富的思想与情感。为实现该目标,我们提出一种将具有复杂语义的原始描述转化为语义对应图像的框架。主要挑战在于原始描述语义的复杂性,其可能难以被可视化(如“阴郁的”或“亚洲的”)。这通常会给现有方法处理此类描述带来挑战。为解决此问题,我们提出一种基于提示的跨模态生成框架(PCM-Frame),以利用两个强大的预训练模型,包括CLIP与StyleGAN。我们的框架由两个组件构成:基于提示从文本嵌入到图像嵌入的投影模块,以及构建于StyleGAN之上、以图像嵌入为输入并通过组合语义一致性损失训练的适配图像生成模块。为弥合真实图像与插画设计之间的差距,我们在框架中进一步采用风格化模型作为后处理以获得更好视觉效果。得益于预训练模型,我们的方法可处理复杂描述且无需外部配对数据训练。此外,我们构建了一个包含200条原始描述的基准。我们开展了用户研究,以证明相比处理复杂文本的竞争方法的优越性。我们的代码发布于https://github.com/researchmm/AI_Illustrator。

关键词

引用

@article{arxiv.2209.03160,
  title  = {AI Illustrator: Translating Raw Descriptions into Images by Prompt-based Cross-Modal Generation},
  author = {Yiyang Ma and Huan Yang and Bei Liu and Jianlong Fu and Jiaying Liu},
  journal= {arXiv preprint arXiv:2209.03160},
  year   = {2022}
}