中文

RAVEN:基于一致性模型 GRPO 的实时自回归视频外推

计算机视觉与模式识别 2026-05-15 v1

摘要

因果自回归视频扩散模型支持通过从先前生成的内容 extrapolate 未来片段来实现实时流式生成。从高保真双向教师模型蒸馏得到具竞争性能的少步模型,但在训练期间遇到的历史分布与推理期间产生的分布之间仍存在持续的差距,这限制了在长时间尺度上的生成质量。我们引入了真实自回归视频外推网络(RAVEN),一个在训练时测试的框架,将每个自 rollout 重新打包为干净历史端点与噪声去噪状态的交错序列。这种表述将训练注意力与推理期间的 extrapolate 对齐,并允许下游块损失对历史表示进行监督,这些表示是依赖于未来预测的。我们进一步提出了一致性模型组相对策略优化(CM-GRPO),将一致性采样步骤重新表述为条件高斯转换,并直接对该核函数应用在线强化学习(RL),避免了先前流模型 RL 公式中采用的 Euler-Maruyama 辅助过程。实验表明,RAVEN 在质量、语义和动态程度评估方面超过了最近的因果视频蒸馏基线,CM-GRPO 在与 RAVEN 结合使用时提供了进一步的提升。

关键词

引用

@article{arxiv.2605.15190,
  title  = {RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO},
  author = {Yanzuo Lu and Ronglai Zuo and Jiankang Deng},
  journal= {arXiv preprint arXiv:2605.15190},
  year   = {2026}
}

备注

Project Page: https://yanzuo.lu/raven