面向创意图形设计的统一多条件扩散变换器
计算机视觉与模式识别
2026-04-01 v4
摘要
图形设计在广告、营销和多媒体娱乐等视觉传播领域发挥着关键作用。先前的工作通过扩散模型探索了自动化图形设计生成,以简化创意工作流程并 democratize 设计能力。然而,复杂的图形设计场景需要准确遵循用户提供的多种异构元素(如图像、布局和文本)所指定的设计意图,这给现有方法的多条件控制带来了挑战。具体而言,之前的单条件控制模型仅在其专用领域内有效,但难以推广到其他条件;而现有的多条件方法往往缺乏对每个子条件的细粒度控制,同时妥协整体构图的和谐性。为此,我们引入 CreatiDesign,作为自动化图形设计的系统性解决方案,涵盖模型架构和数据集构建。首先,我们设计了一种统一的多条件驱动架构,使异构设计元素的灵活且精确的集成能够通过最小的架构修改来实现基础扩散模型。此外,为确保每个条件精确控制其指定的图像区域并避免条件之间的相互干扰,我们提出了一种多模态注意力掩码机制。此外,我们开发了一个完全自动化的图形设计数据集构建流程,并引入了一个包含 40 万样本、 featuring 多条件注释的新数据集,以及全面的基准测试。实验结果表明,CreatiDesign 在忠实于用户意图方面显著优于现有模型。
引用
@article{arxiv.2505.19114,
title = {CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design},
author = {Hui Zhang and Dexiang Hong and Maoke Yang and Yutao Cheng and Zhao Zhang and Weidong Chen and Jie Shao and Xinglong Wu and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2505.19114},
year = {2026}
}
备注
Accepted by ICLR 2026