Image-POSER:用于多专家图像生成与编辑的反思型强化学习
计算机视觉与模式识别
2025-11-18 v1 人工智能
摘要
最近的文本到图像生成技术已产生强大的单次模型,但没有任何单个系统可靠地执行典型创意工作流程中常见的长期、组合提示。我们提出了Image-POSER,一种反思型强化学习框架,该框架(i)协调多组预训练的文本到图像和图像到图像专家,(ii)通过动态任务分解端到端地处理长形式提示,(iii)通过来自视觉语言模型批评家的结构化反馈在每一步监督对齐。通过将图像合成和编辑建模为马尔可夫决策过程,我们学习出能够自适应地组合跨模型优势的非平凡专家管道。实验表明,Image-POSER 在对齐性、保真度和美学等行业标准和自定义基准测试中超越了基线方法,包括前沿模型,并且在人类评估中始终受到青睐。这些结果表明,强化学习可以赋予AI系统自主分解、重新排序和组合视觉模型的能力,朝着通用视觉助手的方向迈进。
引用
@article{arxiv.2511.11780,
title = {Image-POSER: Reflective RL for Multi-Expert Image Generation and Editing},
author = {Hossein Mohebbi and Mohammed Abdulrahman and Yanting Miao and Pascal Poupart and Suraj Kothawade},
journal= {arXiv preprint arXiv:2511.11780},
year = {2025}
}