RealRAG:基于自反思对比学习的检索增强真实感图像生成
计算机视觉与模式识别
2025-09-16 v3
摘要
最近的文本到图像生成模型,例如 Stable Diffusion V3 和 Flux,取得了显著进展。然而,这些模型严重受限于其有限的知识,即它们自身固定的参数,这些参数是在封闭数据集上训练的。这导致在面对细粒度和未见过的真实世界新物体时,例如特斯拉 Cybertruck 的外观,会出现严重的幻觉或失真。为此,我们提出了首个基于真实物体的检索增强生成框架,该框架通过学习和检索真实世界图像来增强细粒度和未见过的物体生成,以克服生成模型的知识差距。具体来说,为了整合缺失的记忆以生成未见过的物体,我们通过自反思对比学习训练了一个反思性检索器,该检索器将生成器的知识注入到自反思负样本中,确保检索到的增强图像能够弥补模型缺失的知识。此外,该基于真实物体的框架为生成模型整合了细粒度视觉知识,解决了失真问题并提高了细粒度物体生成的逼真度。我们的 RealRAG 在模块化应用于所有类型的当前最先进文本到图像生成模型方面表现出优越性,并且为所有这些模型带来了显著的性能提升,例如在 Stanford Car 基准测试上,自回归模型的 FID 分数提升了 16.18%。
引用
@article{arxiv.2502.00848,
title = {RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning},
author = {Yuanhuiyi Lyu and Xu Zheng and Lutao Jiang and Yibo Yan and Xin Zou and Huiyu Zhou and Linfeng Zhang and Xuming Hu},
journal= {arXiv preprint arXiv:2502.00848},
year = {2025}
}
备注
Accepted to ICML2025