中文

RealGen:通过探测器引导奖励实现的逼真文本到图像生成

计算机视觉与模式识别 2025-12-02 v1 人工智能

摘要

随着图像生成技术的持续进步,像 GPT-Image-1 和 Qwen-Image 这类高级模型在文本到图像一致性和世界知识方面取得了显著成果。然而,这些模型在逼真图像生成方面仍有不足。即便在简单的 T2I 任务中,也容易产生具有 "过度光滑皮肤" 和 "油性面部光泽" 等特征的 "仿假" 图像。为了重新实现 "无可区分于现实" 的生成目标,我们提出了 RealGen,一个逼真文本到图像框架。RealGen 集成了用于提示优化的大语言模型组件和用于逼真图像生成的扩散模型。受对抗生成启发,RealGen 引入了 "探测器奖励" 机制,该机制利用语义层面和特征层面的合成图像探测器来量化图像中的缺陷并评估现实感。我们利用该奖励信号结合 GRPO 算法优化整个生成管道,显著提升图像的逼真度和细节。此外,我们提出了 RealBench,一个采用探测器评分和竞技场评分的自动化评估基准,实现人工无关的逼真度评估,结果更准确且符合真实用户体验。实验表明,RealGen 在逼真度、细节和美学方面显著优于通用模型如 GPT-Image-1 和 Qwen-Image,以及专业逼真模型如 FLUX-Krea。代码已公开于 https://github.com/yejy53/RealGen。

关键词

引用

@article{arxiv.2512.00473,
  title  = {RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards},
  author = {Junyan Ye and Leiqi Zhu and Yuncheng Guo and Dongzhi Jiang and Zilong Huang and Yifan Zhang and Zhiyuan Yan and Haohuan Fu and Conghui He and Weijia Li},
  journal= {arXiv preprint arXiv:2512.00473},
  year   = {2025}
}