中文

课程组成策略优化:用于释放文本到图像生成潜力的自适应抽样

机器学习 2026-05-19 v1

摘要

文本到图像(T2I)生成近年来取得了显著进展。同时,基于组成相对策略优化(GRPO)的强化学习方法引起了广泛关注并成功应用于 T2I 任务。然而,训练期间常用的均匀抽样策略往往忽略样本难度与模型当前学习能力之间的匹配,导致训练效率低下。我们认为提高训练效率需要持续优先选择与模型演化能力相匹配且仍具学习潜力的提示词。为此,我们提出了课程组成策略优化(CGPO),一种自适应课程训练框架。在训练过程中,每个提示词会生成一组由奖励模型评分的图像。我们使用组奖励方差作为提示词不一致性的在线代理。方差较大表明模型已部分捕获提示词要求但尚未实现稳定掌握,此类提示词更可能提供有用的学习信号,因此相应提高其抽样概率。此外,为解决多类别数据集中的不平衡问题,我们设计了基于比例公平优化的类别校准方法,在类别之间平衡训练难度。实验在 GenEval、T2I-CompBench++ 和 DPG Bench 上均表明,我们的框架有效提升了生成性能。

关键词

引用

@article{arxiv.2605.17806,
  title  = {AMO: Adaptive Muon Orthogonalization},
  author = {Xinlin Zhuang and Panyi Ouyang and Yichen Li and Jiangming Shi and Yizhang Chen and Shuman Liu and Ying Qian and Weiyang Liu and Haibo Zhang and Imran Razzak},
  journal= {arXiv preprint arXiv:2605.17806},
  year   = {2026}
}

备注

preprint, under-review