作为熵正则化强化学习的生成流网络
机器学习
2024-02-27 v3 机器学习
摘要
近期提出的生成流网络(GFlowNets)是一种通过一系列动作训练策略以正比于给定奖励的概率采样组合离散对象的方法。GFlowNets 利用了问题的序贯本质,与强化学习(RL)形成类比。我们的工作将 RL 与 GFlowNets 的联系扩展到一般情形。我们展示如何将学习生成流网络的任务高效地重定义为具有特定奖励与正则化器结构的熵正则化 RL 问题。此外,我们通过将标准软 RL 算法应用于若干概率建模任务上的 GFlowNet 训练,阐明了该重构的实用效率。与先前报道的结果相反,我们表明熵 RL 方法可媲美已确立的 GFlowNet 训练方法。这一视角为将 RL 原理整合进生成流网络领域开辟了直接路径。
引用
@article{arxiv.2310.12934,
title = {Generative Flow Networks as Entropy-Regularized RL},
author = {Daniil Tiapkin and Nikita Morozov and Alexey Naumov and Dmitry Vetrov},
journal= {arXiv preprint arXiv:2310.12934},
year = {2024}
}
备注
AISTATS 2024 (Oral)