中文

Qwen-Image-Layered:通过图层分解实现内在可编辑性

计算机视觉与模式识别 2025-12-18 v1

摘要

近期视觉生成模型常因栅格图像的纠缠性而难以在编辑期间保持一致性——所有视觉内容被融合到单一画布中。相较之下,专业设计工具采用分层表示,允许孤立编辑而保持一致性。为此,我们提出 Qwen-Image-Layered,这是一种端到端扩散模型,将单张 RGB 图像分解为多个语义上解缝的 RGBA 图层,从而实现“内在可编辑性”,即每个 RGBA 图层可独立操作而不影响其他内容。为支持可变长度分解,我们引入三个关键组件:(1) 一种 RGBA-VAE 用于统一 RGB 与 RGBA 图像的潜在表示;(2) 一种 VLD-MMDiT(Variable Layers Decomposition MMDiT)架构,能够对可变数量的图像图层进行分解;(3) 一种多阶段训练策略,将预训练的图像生成模型适配为多层图像分解器。此外,为解决高质量多层训练图像稀缺的问题,我们构建了从 Photoshop 文档(PSD)中提取并标注多层图像的管道。实验表明,我们的方法在分解质量上显著优于现有方法,并为一致的图像编辑建立了新范式。我们的代码和模型已发布于 https://github.com/QwenLM/Qwen-Image-Layered

关键词

引用

@article{arxiv.2512.15603,
  title  = {Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition},
  author = {Shengming Yin and Zekai Zhang and Zecheng Tang and Kaiyuan Gao and Xiao Xu and Kun Yan and Jiahao Li and Yilei Chen and Yuxiang Chen and Heung-Yeung Shum and Lionel M. Ni and Jingren Zhou and Junyang Lin and Chenfei Wu},
  journal= {arXiv preprint arXiv:2512.15603},
  year   = {2025}
}

备注

12 pages, 8 figures