中文

利用局部信用分配与不完整轨迹改进 GFlowNet 的训练

机器学习 2023-06-21 v2

摘要

生成流网络(Generative Flow Networks,简称 GFlowNets)与蒙特卡洛马尔可夫链方法相关(因其从由能量函数指定的分布中采样)、与强化学习相关(因其学习一种策略以通过一系列步骤采样组合对象)、与生成模型相关(因其学习表示并从中采样分布)以及与摊销变分方法相关(因其可用于学习在给定先验和似然下近似并从难以处理的后验中采样)。它们被训练为以正比于某奖励函数 R(x)R(x)(或 exp(E(x))\exp(-\mathcal{E}(x)),其中 E(x)\mathcal{E}(x) 表示能量函数)的概率,通过一系列步骤生成对象 xx,该概率在生成轨迹末端给定。如同其他仅在末端给予奖励的 RL 设定,当这些轨迹较长时,训练效率与信用分配可能受损。在以往的 GFlowNet 工作中,无法从不完整轨迹(缺乏终止状态及相应奖励的计算)中进行学习。本文中,我们考虑能量函数不仅可应用于终止状态、也可应用于中间状态的情形。例如当能量函数具有可加性、且各项在轨迹上可用时即可实现。我们展示了如何重新参数化 GFlowNet 状态流函数,以利用每个状态处已累积的部分奖励。这使得即便面对不完整轨迹,也能应用训练目标来更新参数。即便在完整轨迹可用时,能够获得更局部的信用分配与梯度也被发现可加速训练收敛,正如诸多仿真所展示的那样。

关键词

引用

@article{arxiv.2302.01687,
  title  = {Better Training of GFlowNets with Local Credit and Incomplete Trajectories},
  author = {Ling Pan and Nikolay Malkin and Dinghuai Zhang and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2302.01687},
  year   = {2023}
}

备注

ICML 2023