PaCo-RL:用于一致图像生成的强化学习方法
计算机视觉与模式识别
2026-03-17 v2
摘要
一致图像生成需要忠实地在多个图像之间保留身份信息、风格以及逻辑一致性,这对于故事叙述和角色设计等应用至关重要。监督式训练方法由于缺乏捕捉视觉一致性的大规模数据集以及对人类感知偏好建模的复杂性,在完成这一任务方面受限。本文认为,强化学习(RL)通过数据无依赖的方式,使模型能够学习复杂且主观的视觉标准,提供了可行的替代方案。为实现这一目标,我们提出了 PaCo-RL 框架,该框架结合了专业化的一致性奖励模型与高效的 RL 算法。第一个组件 PaCo-Reward 是一个在通过自动子图配对构建的大规模数据集上训练的成对一致性评估器。它通过生成式、自回归评分机制,结合任务感知指令和思考链(CoT)理由,对一致性进行评估。第二个组件 PaCo-GRPO 利用一种新颖的分辨率解耦优化策略,显著降低了 RL 成本,并通过一种对数调制的多奖励聚合机制,确保奖励优化的平衡性和稳定性。跨越两个具有代表性的子任务的广泛实验表明,PaCo-Reward 在人类感知的视觉一致性对齐方面取得了显著提升,PaCo-GRPO 在训练效率和稳定性方面实现了最高的一致性性能。综上,这些结果凸显了 PaCo-RL 作为一致图像生成实用且可扩展解决方案的前景。项目页面地址为 https://x-gengroup.github.io/HomePage_PaCo-RL/。
引用
@article{arxiv.2512.04784,
title = {PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling},
author = {Bowen Ping and Chengyou Jia and Minnan Luo and Changliang Xia and Xin Shen and Zhuohang Dang and Hangwei Qian},
journal= {arXiv preprint arXiv:2512.04784},
year = {2026}
}