中文

KVPO:通过 KV 语义探索实现自回归视频对齐的 ODE 原生 GRPO

计算机视觉与模式识别 2026-05-15 v1

摘要

将流式自回归视频生成器与人类偏好对齐具有挑战性。现有的强化学习方法主要依赖于基于噪声的探索和基于 SDE 的代理策略,这与蒸馏 AR 模型的确定性 ODE 动力学不匹配,并且倾向于扰动低层外观,而非对长程连贯性至关重要的语义故事情节推进。为了解决这些局限性,我们提出了 KVPO,一种用于对齐流式视频生成器的 ODE 原生在线群组相对策略优化框架。为了实现多样性探索,KVPO 引入了一种因果语义探索范式,将变异源从随机噪声转移到历史 KV 缓存。通过对历史 KV 条目进行随机路由,它构建了严格保持在数据流形上的语义多样化生成分支。对于策略建模,KVPO 引入了基于轨迹速度能量的速度场代理策略,该策略在流匹配速度空间中量化分支似然,并产生与原生 ODE 公式完全一致的奖励加权对比目标。在多个蒸馏 AR 视频生成器上的实验表明,在单提示词短视频和多提示词长视频设置中,视觉质量、运动质量和文本-视频对齐方面均取得了一致的提升。

关键词

引用

@article{arxiv.2605.14278,
  title  = {KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration},
  author = {Ruicheng Zhang and Kaixi Cong and Jun Zhou and Zhizhou Zhong and Zunnan Xu and Shuiyang Mao and Wei Liu and Xiu Li},
  journal= {arXiv preprint arXiv:2605.14278},
  year   = {2026}
}