增强定制化文本到图像生成的细节保留:一种无正则化方法
计算机视觉与模式识别
2023-05-24 v1
摘要
近期的文本到图像生成模型已展现出生成文本对齐且高保真图像的令人印象深刻的能力。然而,生成用户给定输入图像所提供的新概念的图像仍是一项具有挑战性的任务。为解决该问题,研究者一直在探索各种用于定制预训练文本到图像生成模型的方法。目前,大多数现有的定制预训练文本到图像生成模型的方法都涉及使用正则化技术以防止过拟合。虽然正则化会缓解定制挑战并带来相对于文本引导的成功内容创建,但它可能限制模型能力,导致细节信息丢失和性能下降。在这项工作中,我们提出了一种无需使用正则化的定制化文本到图像生成新框架。具体而言,我们提出的框架由一个编码器网络和一个新颖采样方法组成,其可在不使用正则化的情况下解决过拟合问题。借助所提框架,我们能够在单GPU上仅用用户提供的一张图像,在半分钟内定制大规模文本到图像生成模型。我们在实验中证明,所提框架优于现有方法,并保留了更多细粒度细节。
引用
@article{arxiv.2305.13579,
title = {Enhancing Detail Preservation for Customized Text-to-Image Generation: A Regularization-Free Approach},
author = {Yufan Zhou and Ruiyi Zhang and Tong Sun and Jinhui Xu},
journal= {arXiv preprint arXiv:2305.13579},
year = {2023}
}