奖励驱动:具有奖励反馈的自回归视频生成
计算机视觉与模式识别
2026-04-06 v2 机器学习
摘要
虽然先前的大多数视频生成工作依赖于双向架构,但近期的努力试图将这些模型改编为自回归变体,以支持近实时生成。然而,这种改编通常严重依赖于教师模型,这可能会限制性能,特别是在缺乏强自回归教师的情况下,导致输出质量通常落后于其双向对应模型。在本文中,我们探索了一种替代方法,该方法使用奖励信号来指导生成过程,从而实现更高效和可扩展的自回归生成。通过使用奖励信号来引导模型,我们的方法简化了训练,同时保持了高视觉保真度和时间一致性。通过在标准基准上的大量实验,我们发现我们的方法性能与现有的自回归模型相当,并且在某些情况下,通过避免教师架构施加的约束,超越了类似大小的双向模型。例如,在VBench上,我们的方法获得了84.92的总分,与得分84.31但需要大量异构蒸馏的最先进自回归方法非常接近。
引用
@article{arxiv.2601.16933,
title = {Reward-Forcing: Autoregressive Video Generation with Reward Feedback},
author = {Jingran Zhang and Ning Li and Yuanhao Ban and Andrew Bai and Justin Cui},
journal= {arXiv preprint arXiv:2601.16933},
year = {2026}
}
备注
https://openreview.net/forum?id=K8Qjsxxl7y¬eId=K8Qjsxxl7y