Ctrl-X:无需引导的文本到图像生成中控制结构与外观
计算机视觉与模式识别
2024-12-12 v2 机器学习
摘要
近期的可控生成方法如 FreeControl 和 Diffusion Self-Guidance 引入了细粒度的空间和外观控制,使其能够在不训练辅助模块的情况下控制文本到图像扩散模型。然而,这些方法需要在较长的扩散步骤中针对每种得分函数优化 latent embedding,从而使生成过程耗时且限制了其灵活性和实用性。本文提出了 Ctrl-X,一个简单框架,用于在无需额外训练或引导的情况下控制文本到图像生成中的结构与外观。Ctrl-X 设计了前馈结构控制,以实现与结构图像的对齐,并通过语义感知的外观迁移来促进来自用户输入图像的外观迁移。广泛的定性和定量实验表明,Ctrl-X 在 various condition inputs 和 model checkpoints 上表现优异。特别是,Ctrl-X 支持任意条件图像(任何模态)的 novel 结构和外观控制,显示出比现有工作更优异的图像质量和外观迁移效果,并为任何文本到图像和文本到视频扩散模型提供即插即用的功能。详见项目页面:https://genforce.github.io/ctrl-x
引用
@article{arxiv.2406.07540,
title = {Ctrl-X: Controlling Structure and Appearance for Text-To-Image Generation Without Guidance},
author = {Kuan Heng Lin and Sicheng Mo and Ben Klingher and Fangzhou Mu and Bolei Zhou},
journal= {arXiv preprint arXiv:2406.07540},
year = {2024}
}
备注
22 pages, 17 figures, see project page at https://genforce.github.io/ctrl-x