无限维扩散模型下的可控大图像合成:$\infty$-Brush
计算机视觉与模式识别
2024-07-23 v1
摘要
从复杂的特定领域信息合成高分辨率图像是生成模型中的重要挑战,尤其是针对数字组织病理和遥感等大图像领域的应用。现有方法面临关键限制:像素或潜在空间中的条件扩散模型无法在其训练的分辨率之上保持保真度,且更大图像尺寸的计算需求显著增加。基于补丁的方法虽具计算效率,但由于过度依赖局部信息,难以捕获长程空间关系。在本文中,我们提出了一种在无限维度上的条件扩散模型,-Brush,用于可控大图像合成。我们提出了一种交叉注意力神经算子,以实现函数空间中的条件化。我们的模型克服了传统有限维扩散模型和基于补丁的方法的限制,具备可扩展性和在保持全局图像结构的同时维持细节的卓越能力。到目前为止,-Brush 是已知第一种在函数空间中的条件扩散模型,能够可控地合成最高达 像素的图像。代码已在 https://github.com/cvlab-stonybrook/infinity-brush 上提供。
引用
@article{arxiv.2407.14709,
title = {$\infty$-Brush: Controllable Large Image Synthesis with Diffusion Models in Infinite Dimensions},
author = {Minh-Quan Le and Alexandros Graikos and Srikar Yellapragada and Rajarsi Gupta and Joel Saltz and Dimitris Samaras},
journal= {arXiv preprint arXiv:2407.14709},
year = {2024}
}
备注
Accepted to ECCV 2024. Project page: https://histodiffusion.github.io