MRT:用于分层图像生成与编辑的掩码区域变换器
计算机视觉与模式识别
2026-05-27 v1
摘要
分层图像生成与编辑是一种基础能力,使生成的视觉内容能够实现图层级复用、编辑和合成,类似于自然语言中的词级编辑。尽管其重要性不言而喻,但在大规模场景下仍属未被充分探索的领域。为填补这一空白,我们提出MRT,这是一个200亿参数的掩码区域扩散模型,专为多层透明图像生成与编辑而设计,训练于超过1000万组多语言设计样本,涵盖多种宽高比和文本提示。为充分利用该规模,我们做出了两个关键技术贡献。首先,我们将文本到图层、图像到图层和图层到图层三个互补任务统一整合到共享的掩码区域扩散框架中,其中选择性标记令牌实现灵活的图层级生成与编辑。其次,为实现溢出图层生成,我们引入溢出感知画布图层,处理边界不一致并支持半透明背景合成,使可编辑图层得以延伸至可见画布边界之外。此外,我们应用扩散蒸馏实现8步实时多层生成,同时保持最低质量损失。广泛的实验表明,我们的框架在所有三个任务上均显著优于先前的状态方法,包括各种商业系统,树立了多层透明图像生成的新基准。值得注意的是,根据用户调查结果,我们的模型在图像到图层质量方面显著优于同步的Qwen-Image-Layered模型,同时实现了10-100倍的推理速度加速,在图像到图层推理期间将激活 GPU 内存消耗降低50-90%。
引用
@article{arxiv.2605.27235,
title = {MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale},
author = {Zhicong Tang and Zhao Zhang and Jingye Chen and Mohan Zhou and Yifan Pu and Yuchi Liu and Yalong Bai and Ethan Smith and Yuhui Yuan},
journal= {arXiv preprint arXiv:2605.27235},
year = {2026}
}
备注
CVPR 2026