中文

ImageRAGTurbo:面向一步文本到图像生成的检索增强扩散模型

计算机视觉与模式识别 2026-02-16 v1

摘要

扩散模型已成为文本到图像生成的领导性方法。然而,其迭代采样过程将随机噪声逐渐转化为连贯图像,导致显著的延迟,限制了其适用性。虽然近期的少步扩散模型将采样步数减少至甚至只有一步至四步,但往往在图像质量和提示对齐方面受到牺牲,尤其是在一步生成时。此外,这些模型还需要计算密集的训练程序。为此,我们提出了ImageRAGTurbo,一种通过检索增强高效微调少步扩散模型的新方法。给定文本提示,我们从数据库中检索相关文本图像对,并用于条件化生成过程。我们认为,这些检索到的示例为UNet去噪器提供了丰富的上下文信息,帮助在不牺牲图像质量的前提下减少去噪步数。事实上,我们的初始调查表明,使用检索内容编辑去噪器的潜在空间(H\mathcal{H}-空间)而无需额外微调,即可提高提示保真度。为进一步提升生成图像的质量,我们在UNet去噪器中H\mathcal{H}-空间引入可训练的适配器,通过跨注意力机制高效地将检索内容与目标提示融合。实验结果表明,在快速文本到图像生成任务上,我们的方法在不牺牲延迟的前提下,产出高保真图像,优于现有方法。

关键词

引用

@article{arxiv.2602.12640,
  title  = {ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models},
  author = {Peijie Qiu and Hariharan Ramshankar and Arnau Ramisa and René Vidal and Amit Kumar K C and Vamsi Salaka and Rahul Bhagat},
  journal= {arXiv preprint arXiv:2602.12640},
  year   = {2026}
}

备注

11 pages, 7 figures