基于贝叶斯先验引导的优化:学习如何信任视觉生成
计算机视觉与模式识别
2025-11-25 v1 人工智能
摘要
组相对政策优化(GRPO)已成为后训练视觉生成模型中有效且轻量级的框架。然而,其性能基本受制于文本视觉对应性的模糊性:单个提示可能有效描述多种视觉输出,单个图像或视频可能支持多个同样正确的解释。这种多对多关系导致奖励模型生成不确定且判别性较弱的信号,导致GRPO未能充分利用可靠反馈,过度依赖噪声反馈。我们引入贝叶斯先验引导优化(BPGO),这是GRPO的一个新型扩展,通过语义先验锚点显式建模奖励不确定性。BPGO在两个层面上自适应调制优化信任:跨组贝叶斯信任分配强调与先验一致的组更新,同时削弱模糊组;组内先验锚化重归化 sharpened 样本差异,通过扩大自信偏差和压缩不确定得分来实现。 在图像和视频生成任务中,BPGO consistently 提供更强的语义对齐,增强的感知保真度以及更快的收敛速度,优于标准GRPO和最新变体。
引用
@article{arxiv.2511.18919,
title = {Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation},
author = {Ruiying Liu and Yuanzhi Liang and Haibin Huang and Tianshu Yu and Chi Zhang},
journal= {arXiv preprint arXiv:2511.18919},
year = {2025}
}