基于自回归扩散模型的多对多图像生成
计算机视觉与模式识别
2024-04-05 v1
摘要
图像生成的最新进展取得了显著进展,然而现有模型在感知和生成广泛上下文内任意数量相互关联图像方面存在局限性。随着多媒体平台的扩展,对多图像场景(如多视角图像和视觉叙事)的需求不断增长,这一局限性变得日益关键。本文引入了一个用于多对多图像生成的领域通用框架,能够从给定的一组图像中生成相互关联的图像系列,提供了一个可扩展的解决方案,免除了针对不同多图像场景开发特定任务解决方案的需求。为了实现这一点,我们提出了 MIS,一个新的大规模多图像数据集,包含 1200 万个合成多图像样本,每个样本包含 25 张相互关联的图像。利用带有不同潜在噪声的 Stable Diffusion,我们的方法从单个文本描述生成一组相互关联的图像。利用 MIS,我们学习了 M2M,一个用于多对多生成的自回归模型,其中每张图像都在扩散框架内进行建模。在合成 MIS 上的整个训练过程中,该模型擅长从先前图像(合成的或真实的)中捕捉风格和内容,并遵循捕捉到的模式生成新图像。此外,通过特定任务的微调,我们的模型展示了其对各种多图像生成任务的适应性,包括新视角合成和视觉过程生成。
引用
@article{arxiv.2404.03109,
title = {Many-to-many Image Generation with Auto-regressive Diffusion Models},
author = {Ying Shen and Yizhe Zhang and Shuangfei Zhai and Lifu Huang and Joshua M. Susskind and Jiatao Gu},
journal= {arXiv preprint arXiv:2404.03109},
year = {2024}
}