用于自回归图像生成的群组关键 token 策略优化
计算机视觉与模式识别
2025-09-29 v1
摘要
近期的研究将带有可验证奖励的强化学习扩展到了自回归视觉生成,并取得了有前景的进展。然而,现有方法通常对所有图像 token 应用统一的优化,而不同图像 token 对 RLVR 训练的不同贡献尚未被探索。事实上,关键障碍在于如何在 AR 生成过程中识别更关键的图像 token,并对其进行有效的逐 token 优化。为了应对这一挑战,我们提出了群组关键 token 策略优化(),以促进对关键 token 的有效策略优化。我们从三个角度识别基于 RLVR 的 AR 生成中的关键 token,具体为: 因果依赖性:由于单向依赖关系,早期 token 从根本上决定了后续 token 和最终图像效果; 熵诱导的空间结构:具有高熵梯度的 token 对应于图像结构,并桥接不同的视觉区域; RLVR 关注的 token 多样性:在一组采样图像中视觉相似度低的 token 有助于更丰富的 token 级多样性。对于这些识别出的关键 token,我们基于策略模型与参考模型之间的置信度分歧,进一步引入动态的逐 token 优势权重以鼓励探索。通过利用 30\% 的图像 token,GCPO 取得了优于使用全 token 的 GRPO 的性能。在多个文本到图像基准上针对 AR 模型和统一多模态模型的广泛实验证明了 GCPO 在 AR 视觉生成中的有效性。
引用
@article{arxiv.2509.22485,
title = {Group Critical-token Policy Optimization for Autoregressive Image Generation},
author = {Guohui Zhang and Hu Yu and Xiaoxiao Ma and JingHao Zhang and Yaning Pan and Mingde Yao and Jie Xiao and Linjiang Huang and Feng Zhao},
journal= {arXiv preprint arXiv:2509.22485},
year = {2025}
}
备注
Code is available at https://github.com/zghhui/GCPO