基于流形的强化学习视频生成探索
计算机视觉与模式识别
2026-03-24 v1 人工智能
摘要
类似 FlowGRPO 的组相对策略优化(GRPO)方法在视频生成任务中的可靠性远低于语言模型和图像模型。这一差距源于视频生成具有复杂的解空间,且用于探索的 ODE-to-SDE 转换会引入过多噪声,降低 rollout 质量,使奖励估计不够可靠,从而使 post-training 对齐不稳定。为解决此问题,我们将预训练模型视为定义有效视频数据流形,并将核心问题形式化为约束探索位于该流形附近,以确保保留 rollout 质量并保持奖励估计的可靠性。我们提出了 SAGE-GRPO(Stable Alignment via Exploration),在微观和宏观两个层面施加约束。在微观层面,我们推导了带有对数曲率校正的精确流形感知 SDE,并引入了梯度范数均衡器以稳定跨时间步的采样和更新。在宏观层面,我们使用带有周期性移动锚点和分步约束的双信任区域,以便信任区域跟踪更接近流形的检查点,并限制长期漂移。我们在 HunyuanVideo1.5 上评估了 SAGE-GRPO,采用原始 VideoAlign 作为奖励模型,观察其在 VQ、MQ、TA 和视觉指标(CLIPScore、PickScore)方面 consistently 优于先前方法,展示了在奖励最大化和整体视频质量方面的优越性能。代码和视觉画廊可在 https://dungeonmassster.github.io/SAGE-GRPO-Page/ 查看。
引用
@article{arxiv.2603.21872,
title = {Manifold-Aware Exploration for Reinforcement Learning in Video Generation},
author = {Mingzhe Zheng and Weijie Kong and Yue Wu and Dengyang Jiang and Yue Ma and Xuanhua He and Bin Lin and Kaixiong Gong and Zhao Zhong and Liefeng Bo and Qifeng Chen and Harry Yang},
journal= {arXiv preprint arXiv:2603.21872},
year = {2026}
}
备注
17 pages, 12 figures