MultiBooth:从文本生成图像中获取所有概念
计算机视觉与模式识别
2025-04-01 v3
摘要
本文引入了 MultiBooth,一种用于从文本生成图像中实现多概念定制的新型且高效技术。尽管定制化生成方法在扩散模型方面取得了显著进展,但现有方法在多概念场景中往往难以实现高概念保真度和高推理成本。MultiBooth 通过将多概念生成过程分为两个阶段来解决这些问题:单个概念学习阶段和多概念集成阶段。在单个概念学习阶段,我们采用多模态图像编码器和一种高效概念编码技术,为每个概念学习一个简洁且判别性强的表示。在多概念集成阶段,我们使用边界框在交叉注意力图中定义每个概念的生成区域。该方法使我们能够在其指定区域内创建单个概念,从而促进多概念图像的形成。该策略不仅提高了概念保真度,而且还减少了额外的推理成本。MultiBooth 在定性和定量评估中均优于各种基线,展示了其卓越的性能和计算效率。项目页面:https://multibooth.github.io/
引用
@article{arxiv.2404.14239,
title = {MultiBooth: Towards Generating All Your Concepts in an Image from Text},
author = {Chenyang Zhu and Kai Li and Yue Ma and Chunming He and Xiu Li},
journal= {arXiv preprint arXiv:2404.14239},
year = {2025}
}
备注
To be published in AAAI 2025