中文

用于对齐文本到图像生成的异步去噪扩散模型

计算机视觉与模式识别 2026-02-27 v2

摘要

扩散模型在生成高质量图像方面取得了令人印象深刻的结果。然而,它们往往难以忠实地将生成图像与输入提示对齐。这种限制与同步去噪有关——所有像素同时从随机噪声演化为清晰图像。因此,在生成过程中,与提示相关的区域只能引用同一噪声水平下的无关区域,无法获得清晰的上下文,从而损害了文本到图像的对齐。为解决此问题,我们提出了异步扩散模型——一种新框架,将不同的像素分配不同的时间步,并重新构建像素级去噪过程。通过动态调节 individual 像素的时间步调度,使与提示相关的区域比无关区域去噪得更慢,从而允许它们利用更清晰的像素间上下文。因此,这些与提示相关的区域在最终图像中实现了更好的对齐。大量实验表明,我们的异步扩散模型可以显著提高跨多样化提示的文本到图像对齐。本工作的代码仓库地址为 https://github.com/hu-zijing/AsynDM。

关键词

引用

@article{arxiv.2510.04504,
  title  = {Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation},
  author = {Zijing Hu and Yunze Tong and Fengda Zhang and Junkun Yuan and Jun Xiao and Kun Kuang},
  journal= {arXiv preprint arXiv:2510.04504},
  year   = {2026}
}

备注

Accepted to ICLR 2026, 25 pages, 13 figures, 6 tables