中文

重新思考基于自上而下方法的分层图形设计生成

计算机视觉与模式识别 2025-07-09 v1

摘要

图形设计对于传递想法和信息至关重要。设计师通常将工作组织为对象、背景和矢量文本图层,以简化编辑。然而,这种工作流程需要相当大的专业知识。随着 GenAI 方法的兴起,大量高质量像素格式的图形设计已更易获取,但这些设计常缺乏可编辑性。尽管如此,非分层设计仍激发人类设计师的灵感,影响他们在布局和文本样式方面的选择,从而指导分层设计的创建。受到这一观察的启发,我们提出了 Accordion,这是一个图形设计生成框架,首次尝试将 AI 生成的设计转换为可编辑的分层设计,同时通过用户提示引导将无意义的 AI 生成文本润色为有意义的替代方案。它建立在在三个精选阶段中发挥不同角色的视觉语言模型 (VLM) 之上。对于每个阶段,我们设计提示来引导 VLM 执行不同任务。与现有自下而上方法(如 COLE 和 Open-COLE)逐步生成元素以创建分层设计不同,我们的方法采用自上而下的方式,通过将视觉和谐参考图像作为全局指导来分解每个图层。此外,我们利用多个视觉专家(如 SAM 和元素移除模型)来促进图形图层的创建。我们使用来自自家图形设计数据集 Design39K 进行训练,该数据集增强了与 AI 生成设计图像及其由自定义 inpainting 模型创建的精细真实值相匹配的图像。实验结果和由设计师进行的用户研究表明,Accordion 在 DesignIntention 数据集上生成了有利的结果,包括文本到模板、向背景添加文本和文本去渲染等任务,也在创建设计变体方面表现突出。

关键词

引用

@article{arxiv.2507.05601,
  title  = {Rethinking Layered Graphic Design Generation with a Top-Down Approach},
  author = {Jingye Chen and Zhaowen Wang and Nanxuan Zhao and Li Zhang and Difan Liu and Jimei Yang and Qifeng Chen},
  journal= {arXiv preprint arXiv:2507.05601},
  year   = {2025}
}

备注

ICCV 2025