中文

CreatiParser:将光栅图形设计生成式解析为可编辑图层

计算机视觉与模式识别 2026-04-22 v1

摘要

图形设计图像由多个可编辑图层组成,如文本、背景和装饰元素,而大多数生成模型产生的是缺乏显式图层结构的光栅化输出,限制了下游编辑。现有的图形设计解析方法通常依赖于结合布局预测、抠图和图像修复的多阶段流水线,这容易受到误差累积的影响且可控性有限。我们提出了一种用于光栅到图层图形设计解析的混合生成框架,该框架将设计图像分解为可编辑的文本、背景和贴纸图层。文本区域使用视觉-语言模型解析为文本渲染协议,从而实现忠实的重建和灵活的重新编辑,而背景和贴纸图层则使用支持 RGBA 的多分支扩散架构生成。我们进一步引入了 ParserReward,并将其与 Group Relative Policy Optimization 相结合,以使生成质量与人类设计偏好对齐。在两个具有挑战性的数据集(即 Parser-40K 和 Crello 数据集)上的大量实验表明,其性能优于现有方法,例如,在所有指标上实现了 23.7% 的总体平均提升。

关键词

引用

@article{arxiv.2604.19632,
  title  = {CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers},
  author = {Weidong Chen and Dexiang Hong and Zhendong Mao and Yutao Cheng and Xinyan Liu and Lei Zhang and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2604.19632},
  year   = {2026}
}