Cocktail:融合多模态控制用于文本条件图像生成
计算机视觉与模式识别
2024-03-01 v1 机器学习
摘要
文本条件扩散模型能够生成具有高保真度且内容多样的图像。然而,语言表征经常对预期目标图像表现出模糊描述,需要引入额外控制信号以增强文本引导扩散模型的有效性。在本工作中,我们提出 Cocktail,一种将多种模态混合为单一嵌入的流水线,结合广义 ControlNet(gControlNet)、可控归一化(ControlNorm)和空间引导采样方法,以实现文本条件扩散模型的多模态与空间精细化控制。具体而言,我们引入超网络 gControlNet,致力于将来自不同模态的控制信号对齐并注入预训练扩散模型。gControlNet 能够接受灵活的模态信号,包括同时接收任意模态信号组合,或补充融合多个模态信号。随后根据我们提出的 ControlNorm 将控制信号融合并注入主干模型。此外,我们先进的空间引导采样方法将控制信号熟练地纳入指定区域,从而避免在生成图像中出现不期望的物体。我们展示了该方法在控制多种模态下的结果,证明了针对多个外部信号的高质量合成与保真度。
引用
@article{arxiv.2306.00964,
title = {Cocktail: Mixing Multi-Modality Controls for Text-Conditional Image Generation},
author = {Minghui Hu and Jianbin Zheng and Daqing Liu and Chuanxia Zheng and Chaoyue Wang and Dacheng Tao and Tat-Jen Cham},
journal= {arXiv preprint arXiv:2306.00964},
year = {2024}
}
备注
Project Page: https://mhh0318.github.io/cocktail/