FR-TTS:基于有效填充奖励信号的NTP图像生成测试时扩展
计算机视觉与模式识别
2025-12-02 v1 人工智能
摘要
测试时扩展(Test-time scaling, TTS)已成为图像生成中流行的技术,通过扩大平行样本数量并使用预训练奖励模型进行筛选,显著提升输出质量。然而,将这一强大方法应用于下一词预测(Next-Token Prediction, NTP)范式仍具有挑战性。主要障碍是,从中间词序列解码的图像奖励与完全生成图像的奖励之间存在较低相关性。因此,这些不完整的中间表示证明是指导修剪方向的质量指示器,这一局限性源于其本质不完整性(在尺度或语义内容方面)。为了有效解决此关键问题,我们引入了基于填充的奖励(Filling-Based Reward, FR)。这种新颖设计通过找到并应用合理的填充方案来完成序列,从而估计中间样本的近似未来轨迹。中间样本与最终样本奖励之间的相关系数,以及多个内在信号如token置信度,均表明FR提供了准确评估中间样本质量的优质且可靠的指标。基于此基础,我们提出了FR-TTS,一种精细化的扩展策略。FR-TTS高效搜索优质填充方案并纳入带动态加权计划的多样性奖励,以实现对中间样本的均衡且全面的评估。我们在多个 established benchmark 和 various reward models 上实验验证了FR-TTS的优越性。代码可在\href{https://github.com/xuhang07/FR-TTS}{https://github.com/xuhang07/FR-TTS}获取。
引用
@article{arxiv.2512.00438,
title = {FR-TTS: Test-Time Scaling for NTP-based Image Generation with Effective Filling-based Reward Signal},
author = {Hang Xu and Linjiang Huang and Feng Zhao},
journal= {arXiv preprint arXiv:2512.00438},
year = {2025}
}