RealCompo:平衡真实性与组合性以改进文本到图像扩散模型
计算机视觉与模式识别
2024-10-15 v3 人工智能
机器学习
摘要
扩散模型在文本到图像生成方面取得了显著进展。然而,现有模型在面对多对象组合生成时仍有诸多困难。在本文中,我们提出了 RealCompo,一种新的免训练且易于迁移的文本到图像生成框架,旨在利用文本到图像模型与空间感知图像扩散模型(例如布局、关键点和分割图)的各自优势,以增强生成图像的真实性与组合性。我们提出了一种直观且新颖的平衡器,用于在去噪过程中动态平衡两个模型的强度,允许任何模型即插即用而无需额外训练。大量实验表明,在多对象组合生成中,我们的 RealCompo 始终优于最先进的文本到图像模型和空间感知图像扩散模型,同时保持生成图像令人满意的真实性与组合性。值得注意的是,我们的 RealCompo 可以无缝扩展至广泛的多种空间感知图像扩散模型和风格化扩散模型。我们的代码可在以下地址获取:https://github.com/YangLing0818/RealCompo
引用
@article{arxiv.2402.12908,
title = {RealCompo: Balancing Realism and Compositionality Improves Text-to-Image Diffusion Models},
author = {Xinchen Zhang and Ling Yang and Yaqi Cai and Zhaochen Yu and Kai-Ni Wang and Jiake Xie and Ye Tian and Minkai Xu and Yong Tang and Yujiu Yang and Bin Cui},
journal= {arXiv preprint arXiv:2402.12908},
year = {2024}
}
备注
NeurIPS 2024. Project: https://github.com/YangLing0818/RealCompo