基于 LLM 指导的零样态文本引导无限图像合成
计算机视觉与模式识别
2024-12-30 v2 人工智能
摘要
文本引导的图像编辑和生成方法在实际应用中具有多样性。然而,文本引导的无限图像合成面临多个挑战:首先,缺乏高分辨率且具有上下文多样性的文本-图像配对数据集;其次,基于文本扩展图像需要全局一致性和丰富的局部上下文理解。以往的研究主要关注有限类别(如自然风景),且需要在高分辨率图像上进行训练。为此,我们提出一种新方法,利用大型语言模型(LLM)实现全局一致性和局部上下文理解,而无需任何高分辨率文本-图像配对训练数据集。我们训练扩散模型,以全局描述和局部描述(由 LLM 和视觉特征生成)为条件进行图像扩展。 在推理阶段,给定图像和全局描述,我们使用 LLM 生成用于扩展输入图像的下一个局部描述。然后,我们利用全局描述、生成的局部描述和视觉特征来扩展图像,以考虑全局一致性和空间局部上下文。在实验中,我们的方法在定量和定性方面均优于基线方法。此外,我们的模型展示了在零样态方式下,利用 LLM 指导实现文本引导任意尺寸图像生成的能力。
引用
@article{arxiv.2407.12642,
title = {Zero-shot Text-guided Infinite Image Synthesis with LLM guidance},
author = {Soyeong Kwon and Taegyeong Lee and Taehwan Kim},
journal= {arXiv preprint arXiv:2407.12642},
year = {2024}
}
备注
This paper is being withdrawn due to issues of misconduct in the experiments presented in Table 2 and Figures 6, 7, and 8. We recognize this as an ethical concern and sincerely apologize to the research community for any inconvenience it may have caused