中文

基于策略的自回归图像模型调参:实例级与分布级奖励

人工智能 2026-05-29 v2

摘要

自回归(AR)模型在图像生成中效果显著,但其标准的最大似然估计训练缺乏对样本质量和多样性的直接优化。虽然强化学习(RL)已用于扩散模型对齐,但这些方法通常 suffers 输出多样性崩溃。类似的AR模型RL方法仅依赖实例级奖励,往往以牺牲分布覆盖性为代价。为此,我们提出一种轻量级RL框架,将基于标记的AR合成建模为马尔可夫决策过程,通过组相对策略优化(GRPO)进行优化。我们的核心贡献是引入一种新型分布级留存即插(LOO-FID)奖励;通过指数移动平均特征矩,显式鼓励样本多样性,防止策略更新中的模式崩溃。我们将其与复合实例级奖励(CLIP和HPSv2)集成,以确保语义和感知保真度,并通过自适应熵正则化项稳定多目标学习。在LlamaGen和VQGAN架构上进行的广泛实验表明,在仅进行几百次调优迭代后,方法在标准质量和多样性指标上均实现显著提升。结果还表明,模型可在无分类器自由引导的情况下生产出具竞争力的样本,绕过其2倍推理成本。

关键词

引用

@article{arxiv.2603.23085,
  title  = {When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision-Language Models},
  author = {Jianxin Lin and Chunzheng Zhu and Peter J. Kneuertz and Yunfei Bai and Yuan Xue},
  journal= {arXiv preprint arXiv:2603.23085},
  year   = {2026}
}

备注

Accepted by CVPR 2026 Findings