SceneBooth:基于扩散模型的主体保留文本到图像生成框架
计算机视觉与模式识别
2025-01-08 v1
摘要
由于个人化图像生成的需求,主体驱动的文本到图像生成方法受到广泛关注,这类方法根据文本提示创建输入主体的新颖呈现形式。现有方法通常学习主体表示并将其纳入提示嵌入以引导图像生成,但在保持主体保真度方面存在困难。为解决此问题,本文提出了名为SceneBooth的新框架用于主体保留文本到图像生成,该框架接受主体图像、对象短语和文本提示作为输入。不同于学习主体表示并生成主体,我们的SceneBooth固定给定的主体图像,根据文本提示生成其背景图像。为此,SceneBooth引入了两个关键组件,即多模态布局生成模块和背景绘图模块。前者通过生成与文本标题、对象短语和主体视觉信息相匹配的场景布局来确定主体的位置和尺度。后者将两个适配器(ControlNet 和 Gated Self-Attention)集成到潜在扩散模型中,以根据场景布局和文本描述生成与主体和谐的背景。如此一来,SceneBooth确保了输出中主体外观的准确保留。定量和定性实验结果表明,SceneBooth 在主体保留、图像和谐性和整体质量方面显著优于基线方法。
关键词
引用
@article{arxiv.2501.03490,
title = {SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation},
author = {Shang Chai and Zihang Lin and Min Zhou and Xubin Li and Liansheng Zhuang and Houqiang Li},
journal= {arXiv preprint arXiv:2501.03490},
year = {2025}
}