FreeControl:任意文本到图像扩散模型的免训练空间控制与任意条件
计算机视觉与模式识别
2023-12-13 v1
摘要
最近的方法如ControlNet为用户提供了对文本到图像(T2I)扩散模型的细粒度空间控制。然而,必须为每种空间条件类型、模型架构和检查点训练辅助模块,这与人类设计师在内容创建过程中希望向AI模型传达的多样化意图和偏好相矛盾。在这项工作中,我们提出了FreeControl,一种无需训练的可控T2I生成方法,同时支持多种条件、架构和检查点。FreeControl设计了结构引导以促进与引导图像的结构对齐,以及外观引导以实现使用相同种子生成的图像之间的外观共享。大量的定性和定量实验表明,FreeControl在各种预训练T2I模型上具有优越的性能。特别是,FreeControl促进了对许多不同架构和检查点的便捷无训练控制,允许大多数现有无训练方法失败的具有挑战性的输入条件,并实现了与基于训练的方法相竞争的综合质量。
引用
@article{arxiv.2312.07536,
title = {FreeControl: Training-Free Spatial Control of Any Text-to-Image Diffusion Model with Any Condition},
author = {Sicheng Mo and Fangzhou Mu and Kuan Heng Lin and Yanli Liu and Bochen Guan and Yin Li and Bolei Zhou},
journal= {arXiv preprint arXiv:2312.07536},
year = {2023}
}
备注
Project Page: https://genforce.github.io/freecontrol/