中文

跟随直觉:为自回归图像生成扩展置信度

计算机视觉与模式识别 2026-01-07 v2

摘要

测试时扩展(Test-time scaling, TTS)在提升大语言模型方面取得了显著成功,但其应用于基于下一个标记预测(NTP)的自回归(AR)图像生成仍鲜有探索。现有针对视觉AR(VAR)的TTS方法依赖频繁的部分解码和外部奖励模型,由于中间解码结果的内在不完整性,这些方法不适用于NTP-based图像生成。为弥合这一差距,我们引入了ScalingAR——首个专为NTP-based AR图像生成设计的TTS框架,无需提前解码或辅助奖励。ScalingAR 将标记熵作为视觉标记生成的新信号,在两个互补的扩展层次上运作:(i)轮廓层级(Profile Level),通过融合内在信号与条件信号,流式传输校准后的置信度状态;(ii)策略层级(Policy Level),利用该状态自适应终止低置信度轨迹,并动态安排引导,以实现针对特定阶段的条件强度调度。在通用基准和组合成分基准上的实验表明,ScalingAR(1)在GenEval 上提升基线模型12.5%,在TIIF-Bench 上提升15.2%;(2)在超越基线的同时,高效地将视觉标记消耗降低62.0%;(3)成功提升鲁棒性,使在挑战性场景下的性能下降幅度降低26.0%。

关键词

引用

@article{arxiv.2509.26376,
  title  = {Go with Your Gut: Scaling Confidence for Autoregressive Image Generation},
  author = {Harold Haodong Chen and Xianfeng Wu and Wen-Jie Shu and Rongjin Guo and Disen Lan and Harry Yang and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2509.26376},
  year   = {2026}
}

备注

Code: https://github.com/EnVision-Research/ScalingAR