中文

VAR RL Done Right:解决视觉自回归生成中的异步策略冲突

计算机视觉与模式识别 2026-01-06 v1 机器学习

摘要

视觉生成主要基于三大范式:自回归(AR)、扩散模型和视觉自回归(VAR)模型。与AR和扩散模型不同,VAR模型在其生成步骤中 operates on 异构的输入结构,这导致严重的异步策略冲突。在强化学习(RL)场景中,这一问题尤为突出,导致训练不稳定和对齐效果不佳。为解决此问题,我们提出一种新框架,通过显式管理这些冲突来增强群相对策略优化(GRPO)。本方法集成三个协同组件:1)用于引导早期生成的稳定中间奖励;2)用于精确信用分配的动态时间步重加权方案;3)源自奖励反馈学习(ReFL)原则的新型掩码传播算法,旨在在空间和时间上隔离优化效应。我们的方法在样本质量和目标对齐方面显著优于基础GRPO基线,使VAR模型能够实现稳健且有效的优化。

关键词

引用

@article{arxiv.2601.02256,
  title  = {VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation},
  author = {Shikun Sun and Liao Qu and Huichao Zhang and Yiheng Liu and Yangyang Song and Xian Li and Xu Wang and Yi Jiang and Daniel K. Du and Xinglong Wu and Jia Jia},
  journal= {arXiv preprint arXiv:2601.02256},
  year   = {2026}
}

备注

Project page: https://github.com/ByteVisionLab/NextFlow