中文

关于训练GFlowNets的散度度量

机器学习 2026-04-13 v2 人工智能 机器学习

摘要

生成流网络(GFlowNets)是摊销推理模型,旨在从可组合对象上的未归一化分布中采样,应用于因果发现、自然语言处理和药物发现等领域的生成建模任务。传统上,GFlowNets的训练过程旨在最小化提议(前向策略)和目标(后向策略)分布之间的期望对数平方差,这强制执行了某些流匹配条件。虽然这种训练过程与变分推理(VI)密切相关,但直接尝试标准的Kullback-Leibler(KL)散度最小化可能导致有偏且可能高方差的估计器。因此,我们首先回顾了四种散度度量,即Rényi-α、Tsallis-α、反向和正向KL,并在训练GFlowNets的背景下为它们的随机梯度设计了统计上高效的估计器。然后,我们验证了适当最小化这些散度会产生一个可证明正确且经验上有效的训练方案,通常导致比先前提出的优化方法快得多的收敛速度。为了实现这一点,我们基于REINFORCE留一法和分数匹配估计器设计了控制变量,以减少学习目标梯度的方差。我们的工作有助于缩小GFlowNets训练与广义变分近似之间的差距,为受散度最小化观点启发的算法思想铺平了道路。

关键词

引用

@article{arxiv.2410.09355,
  title  = {On Divergence Measures for Training GFlowNets},
  author = {Tiago da Silva and Eliezer de Souza da Silva and Diego Mesquita},
  journal= {arXiv preprint arXiv:2410.09355},
  year   = {2026}
}

备注

Accepted at NeurIPS 2024, https://openreview.net/forum?id=N5H4z0Pzvn