中文

文本到图像扩散模型的开发与增强

计算机视觉与模式识别 2025-03-10 v1 人工智能

摘要

本研究专注于文本到图像去噪扩散模型的开发与增强,解决了样本多样性有限和训练不稳定等关键挑战。通过引入无分类器引导(CFG)和指数移动平均(EMA)技术,本研究显著提升了图像质量、多样性和稳定性。利用Hugging Face最先进的文本到图像生成模型,所提出的增强方法在生成人工智能领域建立了新的基准。本工作探讨了扩散模型的基本原理,实施了先进的策略以克服现有限制,并对所取得的改进进行了全面评估。结果表明,在从文本描述生成稳定、多样且高质量的图像方面取得了实质性进展,推进了生成人工智能领域,并为未来应用奠定了新的基础。关键词:文本到图像,扩散模型,无分类器引导,指数移动平均,图像生成。

关键词

引用

@article{arxiv.2503.05149,
  title  = {Development and Enhancement of Text-to-Image Diffusion Models},
  author = {Rajdeep Roshan Sahu},
  journal= {arXiv preprint arXiv:2503.05149},
  year   = {2025}
}