从广泛探索到稳定合成:基于熵的自回归图像生成优化
机器学习
2026-04-06 v1 计算机视觉与模式识别
摘要
将链律思考(CoT)与强化学习(RL)结合可改进文本到图像(T2I)生成,但CoT的探索与RL的优化之间的底层交互仍不明确。我们提出了系统性的熵基分析,得出三个关键见解:(1)CoT扩大了生成探索空间,而RL将其收缩到高奖励区域;(2)最终奖励与图像标记熵的均值和方差呈强烈负相关,凸显降低不确定性和不稳定性的必要性;(3)文本CoT的熵直接决定下游图像质量,低熵CoT导致更好的生成。基于这些发现,我们提出了熵导引的群体相对策略优化(EG-GRPO),一种通过不确定性重新分配优化预算的微调策略:排除低熵标记以保持稳定性,高熵标记获得熵奖励以鼓励结构化探索而不致崩溃。在标准T2I基准上的实验表明,EG-GRPO实现了最先进的性能。
引用
@article{arxiv.2604.02355,
title = {From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation},
author = {Han Song and Yucheng Zhou and Jianbing Shen and Yu Cheng},
journal= {arXiv preprint arXiv:2604.02355},
year = {2026}
}