从稀疏到稠密:基于增强条件空间的多视角GRPO用于流模型
计算机视觉与模式识别
2026-03-16 v1
摘要
组相对策略优化(Group Relative Policy Optimization, GRPO)已成为文本到图像(text-to-image, T2I)流模型中偏好对齐的强大框架。然而,我们注意到,标准范式中对一组生成样本针对单个条件进行评估,导致样本间关系探索不足,限制了对齐效能和性能上限。为此,我们提出多视角GRPO(MV-GRPO),一种通过扩充条件空间以创建稠密多视角奖励映射来增强关系探索的新方法。具体而言,对于从同一提示生成的一组样本,MV-GRPO利用灵活的条件增强器(Condition Enhancer)生成语义相邻且多样化的标题。这些标题使我们能够进行多视角优势重新估计,捕捉多样化语义属性,提供更丰富的优化信号。通过推导原始样本在这些新标题条件下的概率分布,我们可将其纳入训练过程,无需重新生成样本。大量实验表明,MV-GRPO在与最先进方法相比时实现了优异的对齐性能。
引用
@article{arxiv.2603.12648,
title = {From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space},
author = {Jiazi Bu and Pengyang Ling and Yujie Zhou and Yibin Wang and Yuhang Zang and Tianyi Wei and Xiaohang Zhan and Jiaqi Wang and Tong Wu and Xingang Pan and Dahua Lin},
journal= {arXiv preprint arXiv:2603.12648},
year = {2026}
}