RePrompt:通过强化学习实现推理增强的重提示用于文本到图像生成
计算机视觉与模式识别
2025-05-26 v1 人工智能
摘要
尽管文本到图像(T2I)生成取得了近期进展,但现有模型通常难以忠实捕捉来自简短且未充分说明的提示的用户意图。虽然先前工作尝试使用大语言模型(LLMs)增强提示,但这些方法由于在视觉语义和现实构图方面的充分基础不足,经常生成风格化或不真实的内容。受语言模型推理最新进展的启发,我们提出了 RePrompt,一种新颖的重提示框架,通过强化学习将显式推理引入提示增强过程。与依赖手工规则或风格化重写不同,我们的方法训练语言模型通过优化图像级结果来生成结构化、自我反思的提示。定制的奖励模型从人类偏好、语义对齐和视觉构图三个方面评估生成的图像,为优化提示生成提供间接监督。我们的方法实现了无需人工标注数据的端到端训练。在 GenEval 和 T2I-Compbench 上的实验表明,RePrompt 显著提升了空间布局保真度和跨多种 T2I 骨干网络的构图泛化能力,建立了新的最先进结果。
引用
@article{arxiv.2505.17540,
title = {RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning},
author = {Mingrui Wu and Lu Wang and Pu Zhao and Fangkai Yang and Jianjin Zhang and Jianfeng Liu and Yuefeng Zhan and Weihao Han and Hao Sun and Jiayi Ji and Xiaoshuai Sun and Qingwei Lin and Weiwei Deng and Dongmei Zhang and Feng Sun and Qi Zhang and Rongrong Ji},
journal= {arXiv preprint arXiv:2505.17540},
year = {2025}
}
备注
Code is available at: https://github.com/microsoft/DKI_LLM/tree/main/RePrompt