导航扩散模型推理时序扩展中的探索-利用权衡
机器学习
2025-08-19 v1 人工智能
统计理论
统计理论
摘要
推理时序扩展在语言模型中取得了显著成功,但在扩散模型上的应用仍有探索不足。我们观察到,近期基于顺序蒙特卡洛(SMC)的方法之所以有效,主要源于对奖励倾斜分布的全局拟合,这本质上在多模态搜索中保持了样本的多样性。然而,当前将SMC应用于扩散模型面临一个根本性困境:早期噪声样本虽然具有高潜在改进价值,但难以准确评估;而晚期样本虽然可靠评估,但基本不可逆。为解决此探索-利用权衡问题,我们从搜索算法的角度提出两种策略:梯度表计划(Funnel Schedule)和自适应温度(Adaptive Temperature)。这些方法简洁而有效,针对扩散模型的独特生成动力学和相变行为设计而成。通过逐步减少所维持的粒子数,并下调早期阶段奖励的影响,我们的方法在不增加噪声函数评估总数的前提下,显著提升了样本质量。实验结果表明,在多个基准测试和最先进的文本到图像扩散模型上,我们的方法优于先前的基线方法。
引用
@article{arxiv.2508.12361,
title = {Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models},
author = {Xun Su and Jianming Huang and Yang Yusen and Zhongxi Fang and Hiroyuki Kasai},
journal= {arXiv preprint arXiv:2508.12361},
year = {2025}
}