PrismLayers:面向高质量多层透明图像生成模型的开放数据
计算机视觉与模式识别
2025-05-29 v1
摘要
从文本提示生成高质量、多层透明图像可以开启全新的创意控制水平,允许用户像编辑 LLMs 的文本输出一样轻松地编辑每一层。然而,由于缺乏大规模、高质量的多层透明数据语料库,多层生成模型的发展落后于常规的文本到图像模型。在本文中,我们通过以下方式解决这一根本挑战: 发布首个开放的、超高清的 PrismLayers (PrismLayersPro) 数据集,包含 20 万(2 万)张带有精确 alpha 遮罩的多层透明图像; 引入一种无需训练的合成流水线,使用现成的扩散模型按需生成此类数据; 提供一个强大的开源多层生成模型 ART+,其美学效果可媲美现代文本到图像生成模型。关键技术贡献包括:LayerFLUX,擅长生成具有精确 alpha 遮罩的高质量单透明层;以及 MultiLayerFLUX,在人工标注的语义布局引导下,将多个 LayerFLUX 输出组合成完整图像。为确保更高质量,我们应用了严格的过滤阶段来去除伪影和语义不匹配,随后进行人工筛选。在我们合成的 PrismLayersPro 上微调 SOTA ART 模型产生 ART+,在 60% 的面对面用户研究比较中优于原始 ART,甚至匹配了 FLUX.1-[dev] 模型生成图像的视觉质量。我们预期我们的工作将为多层透明图像生成任务奠定坚实的数据集基础,支持需要精确、可编辑且视觉上引人注目的分层图像的研究与应用。
引用
@article{arxiv.2505.22523,
title = {PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models},
author = {Junwen Chen and Heyang Jiang and Yanbin Wang and Keming Wu and Ji Li and Chao Zhang and Keiji Yanai and Dong Chen and Yuhui Yuan},
journal= {arXiv preprint arXiv:2505.22523},
year = {2025}
}
备注
Homepage: https://prism-layers.github.io/