中文

多路径环境中的离散概率推断作为控制问题

机器学习 2024-05-29 v2

摘要

我们将从离散结构化分布中采样的问题视为一个序贯决策问题,其目标是找到一个随机策略,使得在该序贯过程结束时,对象按照某个预定义奖励成比例地被采样。虽然我们可以使用最大熵强化学习(MaxEnt RL)来解决某些分布下的这个问题,但已有研究表明,在存在多种方式生成同一对象的情况下,最优策略诱导的状态分布可能存在偏差。为了解决这个问题,生成流网络(GFlowNets)通过在整个马尔可夫决策过程(MDP)中近似守恒流,学习一个按奖励比例采样对象的随机策略。在本文中,我们扩展了最近修正奖励的方法,以保证无论底层MDP结构如何,最优MaxEnt RL策略诱导的边际分布都与原始奖励成比例。我们还证明了GFlowNet文献中的一些流匹配目标实际上等价于具有修正奖励的成熟MaxEnt RL算法。最后,我们在多个涉及从离散分布采样的问题上,实证研究了多种MaxEnt RL和GFlowNet算法的性能。

关键词

引用

@article{arxiv.2402.10309,
  title  = {Discrete Probabilistic Inference as Control in Multi-path Environments},
  author = {Tristan Deleu and Padideh Nouri and Nikolay Malkin and Doina Precup and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2402.10309},
  year   = {2024}
}