中文

二次奖励导引扩散模型:细粒度分析

机器学习 2026-02-19 v1 数据结构与算法

摘要

推理时间算法是一种新兴范式,利用预训练模型作为下游任务的子程序。然而,当前实际应用的方法是带有多种失败模式的启发式方法,我们对何时可以有效改进这些启发式方法几乎没有了解。本文考虑从奖励函数 rr 和预训练扩散oracle pp 中,对奖励倾斜扩散模型进行采样,即从 p(x)p(x)exp(r(x))p^{\star}(x) \propto p(x) \exp(r(x))。我们对二次奖励 r(x)=xAx+bxr(x) = x^\top A x + b^\top x 的计算可行性进行细粒度分析。我们表明线性奖励倾斜始终可被有效采样——这一结果似乎在文献中未受到注意。我们将其作为构建模块,结合一个概念性新要素—— Hubbard-Stratonovich 变换——提供一种高效算法,用于从低秩正定二次倾斜中进行采样,即 r(x)=xAxr(x) = x^\top A x 其中 AA 为正定且秩为 O(1)O(1)。对于负定倾斜,即 r(x)=xAxr(x) = - x^\top A x 其中 AA 为正定,即使 AA 秩为 1(尽管指数级大),我们证明问题不可求解。

关键词

引用

@article{arxiv.2602.16570,
  title  = {Steering diffusion models with quadratic rewards: a fine-grained analysis},
  author = {Ankur Moitra and Andrej Risteski and Dhruv Rohatgi},
  journal= {arXiv preprint arXiv:2602.16570},
  year   = {2026}
}