中文

COLE:一种用于多层可编辑图形设计的分层生成框架

计算机视觉与模式识别 2024-03-20 v2

摘要

自 15 世纪便不断发展的图形设计在广告中起着关键作用。高质量设计的创作需要面向设计的规划、推理与分层生成。与近期将 GPT-4 与现有设计模板集成以构建自定义 GPT 的 CanvaGPT 不同,本文介绍了 COLE 系统——一个旨在全面应对这些挑战的分层生成框架。该 COLE 系统可将模糊的意图提示转化为高质量的多层图形设计,同时支持基于用户输入的灵活编辑。此类输入的示例可能包括诸如“为久石智的音乐会设计一张海报”的指令。关键洞见是将文本到设计的复杂生成任务拆解为层次化的较简单子任务,每个子任务由专门模型协作解决。这些模型的结果随后被整合以产生连贯的最终输出。我们的分层任务分解可简化复杂流程并显著提升生成可靠性。我们的 COLE 系统包含多个微调的大语言模型(LLMs)、大型多模态模型(LMMs)和扩散模型(DMs),分别专门面向设计感知的分层描述、布局规划、推理以及图像与文本生成任务。此外,我们构建了 DESIGNINTENTION 基准,以展示我们的 COLE 系统在从用户意图生成高质量图形设计方面优于现有方法。最后,我们提供了一个类 Canva 的多层图像编辑工具,以支持对所生成多层图形设计图像的灵活编辑。我们认为我们的 COLE 系统是朝着未来解决更复杂且多层的图形设计生成任务迈出的重要一步。

关键词

引用

@article{arxiv.2311.16974,
  title  = {COLE: A Hierarchical Generation Framework for Multi-Layered and Editable Graphic Design},
  author = {Peidong Jia and Chenxuan Li and Yuhui Yuan and Zeyu Liu and Yichao Shen and Bohan Chen and Xingru Chen and Yinglin Zheng and Dong Chen and Ji Li and Xiaodong Xie and Shanghang Zhang and Baining Guo},
  journal= {arXiv preprint arXiv:2311.16974},
  year   = {2024}
}

备注

Technical report. Project page: https://graphic-design-generation-github-io.vercel.app/