TCIG:通过扩散增强质量的两阶段可控图像生成
计算机视觉与模式识别
2024-03-05 v1
摘要
近年来,文本到图像生成模型的开发取得了显著进展。然而,这些模型在生成过程中实现完全可控性方面仍面临局限性。通常需要特定的训练或使用有限的模型,即便如此,它们仍存在某些限制。为了应对这些挑战,提出了一种在图像生成中有效结合可控性和高质量的两阶段方法。该方法利用预训练模型的专业知识来实现对生成图像的精确控制,同时利用扩散模型的力量来实现 SOTA 的质量。通过将可控性与高质量分离,该方法取得了出色的结果。它兼容隐空间和图像空间扩散模型,确保了多功能性和灵活性。此外,该方法持续产生与该领域当前 SOTA 方法相当的结果。总体而言,所提出的方法代表了文本到图像生成的一项重大进步,在不损害生成图像质量的前提下实现了更好的可控性。
引用
@article{arxiv.2403.01212,
title = {TCIG: Two-Stage Controlled Image Generation with Quality Enhancement through Diffusion},
author = {Salaheldin Mohamed},
journal= {arXiv preprint arXiv:2403.01212},
year = {2024}
}