中文

TAGRPO:通过直接轨迹对齐提升图像到视频生成的GRPO

计算机视觉与模式识别 2026-05-27 v2

摘要

近期研究表明,将分组相对策略优化(GRPO)整合到流匹配模型中,尤其是在文本到图像和文本到视频生成中,是有效的。然而,我们发现将这些技术直接应用于图像到视频(I2V)模型通常无法带来一致的奖励提升。为了解决这一局限,我们提出了TAGRPO,这是一个受对比学习启发的、用于I2V模型的稳健后训练框架。我们的方法基于一个观察:从相同初始噪声生成的展开视频能为优化提供更优的指导。利用这一见解,我们提出了一种应用于中间潜变量的新型GRPO损失,鼓励与高奖励轨迹直接对齐,同时最大化与低奖励轨迹的距离。此外,我们为展开视频引入了一个记忆库,以增强多样性并减少计算开销。尽管方法简单,TAGRPO在I2V生成上相比DanceGRPO取得了显著提升。相关成果将在 https://tagrpo.github.io/ 更新。

关键词

引用

@article{arxiv.2601.05729,
  title  = {TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment},
  author = {Jin Wang and Jianxiang Lu and Guangzheng Xu and Comi Chen and Haoyu Yang and Linqing Wang and Peng Chen and Mingtao Chen and Zhichao Hu and Longhuang Wu and Shuai Shao and Qinglin Lu and Ping Luo},
  journal= {arXiv preprint arXiv:2601.05729},
  year   = {2026}
}

备注

18 pages, 12 figures