二次奖励导引扩散模型:细粒度分析
机器学习
2026-02-19 v1 数据结构与算法
摘要
推理时间算法是一种新兴范式,利用预训练模型作为下游任务的子程序。然而,当前实际应用的方法是带有多种失败模式的启发式方法,我们对何时可以有效改进这些启发式方法几乎没有了解。本文考虑从奖励函数 和预训练扩散oracle 中,对奖励倾斜扩散模型进行采样,即从 。我们对二次奖励 的计算可行性进行细粒度分析。我们表明线性奖励倾斜始终可被有效采样——这一结果似乎在文献中未受到注意。我们将其作为构建模块,结合一个概念性新要素—— Hubbard-Stratonovich 变换——提供一种高效算法,用于从低秩正定二次倾斜中进行采样,即 其中 为正定且秩为 。对于负定倾斜,即 其中 为正定,即使 秩为 1(尽管指数级大),我们证明问题不可求解。
引用
@article{arxiv.2602.16570,
title = {Steering diffusion models with quadratic rewards: a fine-grained analysis},
author = {Ankur Moitra and Andrej Risteski and Dhruv Rohatgi},
journal= {arXiv preprint arXiv:2602.16570},
year = {2026}
}