中文

从离散时间策略到连续时间扩散采样器:渐近等价性与更快的训练

机器学习 2026-02-05 v3 机器学习

摘要

我们研究训练神经随机微分方程(即扩散模型)以从玻尔兹曼分布中采样而不访问目标样本的问题。现有训练此类模型的方法通过使用可微模拟或离策略强化学习(RL)来强制生成过程和加噪过程的时间反转。我们证明了在无穷小离散化步长极限下,目标函数族之间的等价性,将熵RL方法(GFlowNets)与连续时间对象(偏微分方程和路径空间测度)联系起来。我们进一步表明,在训练过程中选择合适的粗时间离散化可以大幅提高样本效率,并允许使用时间局部目标函数,在标准采样基准上以降低的计算成本实现有竞争力的性能。

关键词

引用

@article{arxiv.2501.06148,
  title  = {From discrete-time policies to continuous-time diffusion samplers: Asymptotic equivalences and faster training},
  author = {Julius Berner and Lorenz Richter and Marcin Sendera and Jarrid Rector-Brooks and Nikolay Malkin},
  journal= {arXiv preprint arXiv:2501.06148},
  year   = {2026}
}

备注

TMLR final version; code: https://github.com/GFNOrg/gfn-diffusion/tree/stagger