Flash-GRPO:基于单步策略优化的视频扩散高效对齐
计算机视觉与模式识别
2026-05-18 v1
摘要
群相对政策优化(GRPO)已成为视频扩散模型与人类偏好对齐的关键方法,但面临严重的计算瓶颈:训练参数为14B的模型通常需要数百个 GPU 天。现有效率方法通过滑动窗口子采样训练时间步来降低成本,但本质上会损害优化,表现出严重不稳定,无法达到完整轨迹性能。我们提出了 Flash-GRPO,一种单步训练框架,在低计算预算下优于完整轨迹训练,显著提高了训练效率。Flash-GRPO 解决了两个关键挑战:等时分组消除时间步相关方差,通过强制提示级时间一致性,使策略性能与时间步难度分离;时间梯度校正中和导致各时间步梯度幅度差异很大的时间依赖缩放因子。实验在1.3B至14B参数模型上验证了 Flash-GRPO 的有效性,展示了在保持一致稳定性的同时,实现了显著的训练加速和最先进的对齐质量。
引用
@article{arxiv.2605.15980,
title = {Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization},
author = {Xiaoxuan He and Siming Fu and Zeyue Xue and Weijie Wang and Ruizhe He and Yuming Li and Dacheng Yin and Shuai Dong and Haoyang Huang and Hongfa Wang and Nan Duan and Bohan Zhuang},
journal= {arXiv preprint arXiv:2605.15980},
year = {2026}
}