中文

基于多模态层生成的指令式图形设计IGD

计算机视觉与模式识别 2025-07-15 v1

摘要

图形设计通过创建和组合文本、图像和图形来直观地传递信息和数据。依赖主要依赖布局生成的两阶段方法缺乏创造性和智能性,使得图形设计仍然依赖性强。现有基于扩散的方法在图像层面生成非可编辑的图形设计文件,文本渲染可读性差,阻止其实现令人满意且实用的自动化图形设计。在本文中,我们提出了指令式图形设计师(Instructional Graphic Designer, IGD),以仅需自然语言指令即可快速生成具有可编辑灵活性的多模态层。IGD采用一种新范式,利用参数化渲染和图像资产生成。首先,我们开发了一个设计平台并建立了多场景设计文件的标准格式,从而为规模化数据提供了基础。其次,IGD利用多模态理解和推理能力的MLLM来完成属性预测、排序和图层布局。它还采用扩散模型生成资产的图像内容。通过实现端到端训练,IGD在复杂图形设计任务中支持可扩展性和可扩展性。优秀的实验结果表明,IGD为图形设计提供了一种新解决方案。

关键词

引用

@article{arxiv.2507.09910,
  title  = {IGD: Instructional Graphic Design with Multimodal Layer Generation},
  author = {Yadong Qu and Shancheng Fang and Yuxin Wang and Xiaorui Wang and Zhineng Chen and Hongtao Xie and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2507.09910},
  year   = {2025}
}

备注

ICCV 2025