MULAN:用于可控文本到图像生成的多层标注数据集
计算机视觉与模式识别
2024-04-04 v1
摘要
文本到图像生成取得了惊人的成果,但精确的空间可控性和提示保真度仍然极具挑战性。这种局限性通常通过繁琐的提示工程、场景布局条件化或通常需要手绘掩码的图像编辑技术来解决。然而,由于光栅化 RGB 输出图像通常具有的扁平特性,现有工作难以利用场景自然的实例级组合性。为了应对这一挑战,我们引入了 MuLAn:一个新颖的数据集,包含超过 44K 个 RGB 图像的多层标注(作为多层、逐实例的 RGBA 分解)以及超过 100K 张实例图像。为了构建 MuLAn,我们开发了一个无需训练的流程,将单目 RGB 图像分解为包含背景和孤立实例的 RGBA 层堆栈。我们通过使用预训练的通用模型,并开发三个模块来实现这一点:用于实例发现和提取的图像分解,用于重建遮挡区域的实例补全,以及图像重组。我们使用我们的流程创建了 MuLAn-COCO 和 MuLAn-LAION 数据集,它们在风格、构图和复杂性方面包含各种图像分解。借助 MuLAn,我们提供了首个为高质量图像提供实例分解和遮挡信息的真实感资源,为文本到图像生成式 AI 研究开辟了新途径。借此,我们旨在鼓励新型生成和编辑技术的开发,特别是逐层解决方案。MuLAn 数据资源可在 https://MuLAn-dataset.github.io/ 获取。
引用
@article{arxiv.2404.02790,
title = {MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation},
author = {Petru-Daniel Tudosiu and Yongxin Yang and Shifeng Zhang and Fei Chen and Steven McDonagh and Gerasimos Lampouras and Ignacio Iacobacci and Sarah Parisot},
journal= {arXiv preprint arXiv:2404.02790},
year = {2024}
}
备注
CVPR 2024 - Project page: https://MuLAn-dataset.github.io/