中文

AR-CoPO:面向自回归视频生成的对比式策略优化

计算机视觉与模式识别 2026-03-19 v1

摘要

流式自回归(AR)视频生成器结合少步蒸馏可实现低延迟、高质量的合成,但通过强化学习从人类反馈(RLHF)进行对齐仍然困难。现有的基于SDE的GRPO方法在此设置下面临挑战:少步ODE和一致性模型采样器偏离标准流匹配ODE,其短暂且低随机性的轨迹对初始化噪声高度敏感,导致中间SDE探索效果不佳。我们提出AR-CoPO(AutoRegressive Contrastive Policy Optimization),一种框架,使其适应邻居GRPO对比视角于流式AR生成。AR-CoPO通过分叉机制在随机选取的分块处构建邻域候选方案,分配序列级奖励,并执行局部GRPO更新。我们进一步提出一种半基于策略的训练策略,通过引用 rollout 的回放缓冲区中的利用性来补充基于策略的探索,以提升跨领域的生成质量。在Self-Forcing数据集上实验表明,AR-CoPO在基线之外,显著提升了跨域泛化能力和领域内的人类偏好对齐,提供了非奖励作弊的真实对齐证据。

关键词

引用

@article{arxiv.2603.17461,
  title  = {AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization},
  author = {Dailan He and Guanlin Feng and Xingtong Ge and Yi Zhang and Bingqi Ma and Guanglu Song and Yu Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2603.17461},
  year   = {2026}
}