基于 REINFORCE 及 James-Stein Shrinkage 设计实例级抽样计划
机器学习
2026-04-28 v2 计算机视觉与模式识别
摘要
大多数 post-training 方法针对 text-to-image sampler 都聚焦于模型权重:要么通过对齐进行微调,要么通过蒸馏实现 few-step 效率。我们采取不同路径:对冻结 sampler 的抽样时间轴进行重新安排。不采用固定全局计划,而是通过单次 Dirichlet 策略学习 prompt-和 noise-条件下的实例级抽样计划。为确保高维策略学习中梯度估计的准确性,我们引入一种新型奖励基线,基于原则性的 James-Stein 估计器;它在证明上保证低于常用变体的估计误差,从而实现优异性能。我们的重新安排 sampler 在包括文本渲染和组成控制在内的文本-图像对齐方面持续改进,涵盖现代 Stable Diffusion 和 Flux 模型家族。此外,一个 5 步 Flux-Dev sampler 采用我们的计划可实现相当于 Flux-Schnell 等精心蒸馏 sampler 的生成质量。我们因此将调度框架定位为一种新兴的 model-agnostic post-training 杠杆,解锁预训练 sampler 的额外生成潜力。
引用
@article{arxiv.2511.22177,
title = {Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage},
author = {Peiyu Yu and Suraj Kothawade and Sirui Xie and Ying Nian Wu and Hongliang Fei},
journal= {arXiv preprint arXiv:2511.22177},
year = {2026}
}
备注
CVPR 2026; 23 pages