中文

LaDe:统一多层次图形媒体生成与分解

计算机视觉与模式识别 2026-03-19 v1

摘要

媒体设计图层生成通过仅使用自然语言提示即可创建完全可编辑的分层设计文档,如海报、传单和标志。现有方法要么限制输出为固定数量的图层,要么要求每个图层仅包含空间连续区域,从而导致图层数量随设计复杂度线性增长。我们提出LaDe(Layered Media Design),一种潜在扩散框架,用于生成灵活的、语义上有意义的图层。LaDe结合了三个组件:基于LLM的提示扩展器,将简短的用户意图转化为用于引导生成的结构化逐层描述;一种采用4D RoPE位置编码机制的潜在扩散Transformer,联合生成完整的媒体设计及其构成性RGBA图层;以及支持完整alpha通道的RGBA VAE。通过在训练时对图层样本进行条件化,我们的统一框架支持三种任务:文本到图像生成、文本到图层媒体设计生成和媒体设计分解。在Crello测试集上与Qwen-Image-Layered进行文本到图层和图像到图层任务比较。LaDe在文本到图层生成中优于Qwen-Image-Layered,提升了文本到图层对齐度,两个VLM评判器(GPT-4o mini和Qwen3-VL)均对其表现予以验证。

关键词

引用

@article{arxiv.2603.17965,
  title  = {LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition},
  author = {Vlad-Constantin Lungu-Stan and Ionut Mironica and Mariana-Iuliana Georgescu},
  journal= {arXiv preprint arXiv:2603.17965},
  year   = {2026}
}

备注

18 pages (main + supp)