大语言模型引导的弱监督动态KL加权扩散模型
计算与语言
2025-02-04 v1
摘要
本文提出了一种通过结合大语言模型(LLM)与扩散模型来改进文本到图像生成的新方法,这是一种旨在实现从文本描述进行图像合成时获得更高质量和效率的混合方法。我们的方法引入了一种新的动态KL加权策略来优化扩散过程,并结合了来自预训练LLM的语义理解来引导生成过程。所提出的方法显著提升了生成图像的视觉质量及其与文本描述的对齐度,解决了计算效率低下、训练不稳定以及对文本变异性鲁棒性不足等挑战。我们在COCO数据集上评估了我们的方法,并在定量和定性两方面证明了其优于传统基于GAN的模型。包括消融研究和人工评估在内的大量实验证实,我们的方法在图像真实性、与输入文本的相关性以及整体美学质量方面均优于现有方法。我们的方法还显示出可扩展到其他多模态任务的潜力,使其成为适用于广泛生成应用的通用解决方案。
引用
@article{arxiv.2502.00826,
title = {Weak Supervision Dynamic KL-Weighted Diffusion Models Guided by Large Language Models},
author = {Julian Perry and Frank Sanders and Carter Scott},
journal= {arXiv preprint arXiv:2502.00826},
year = {2025}
}