中文

AdaGen:学习自适应策略用于图像合成

计算机视觉与模式识别 2026-03-10 v1

摘要

图像合成的最新进展由强大的生成模型推动,例如掩码生成式Transformer(MaskGIT)、自回归模型、扩散模型和整流流模型。其成功背后的一个共同原理是将合成分解为多个步骤。然而,这引入了大量特定于步骤的参数(例如,每一步的噪声水平或温度)。现有方法通常依赖手动设计的规则来管理这种复杂性,这需要专家知识和反复试验。此外,这些静态调度缺乏适应每个样本独特特征的灵活性,导致性能次优。为了解决这个问题,我们提出了AdaGen,一个通用的、可学习的、样本自适应的框架,用于调度迭代生成过程。具体来说,我们将调度问题形式化为一个马尔可夫决策过程,其中轻量级策略网络根据当前生成状态确定合适的参数,并可以通过强化学习进行训练。重要的是,我们证明了简单的奖励设计,如FID或预训练奖励模型,容易被利用,并且可能无法可靠地保证生成样本的期望质量或多样性。因此,我们提出了一种对抗性奖励设计来指导策略网络的训练。最后,我们引入了一种推理时细化策略和可控的保真度-多样性权衡机制,以进一步增强AdaGen的性能和灵活性。在四种生成范式上的综合实验验证了AdaGen的优越性。例如,AdaGen在DiT-XL上以3倍更低的推理成本实现了更好的性能,并将VAR的FID从1.92提高到1.59,而计算开销可忽略不计。

关键词

引用

@article{arxiv.2603.06993,
  title  = {AdaGen: Learning Adaptive Policy for Image Synthesis},
  author = {Zanlin Ni and Yulin Wang and Yeguo Hua and Renping Zhou and Jiayi Guo and Jun Song and Bo Zheng and Gao Huang},
  journal= {arXiv preprint arXiv:2603.06993},
  year   = {2026}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Journal version of arXiv:2409.00342 (ECCV 2024). Code is available at: https://github.com/LeapLabTHU/AdaGen