中文

经验研究:重放缓冲在 GFlowNets 模式发现中有效性的实证分析

机器学习 2023-07-19 v2

摘要

强化学习(RL)算法旨在通过迭代采样动作来学习最优策略,以学会如何最大化总期望回报 R(x)R(x)。GFlowNets 是一类特殊的算法,通过学习近似 R(x)R(x) 比例采样的策略,从离散集合中生成多样化候选 xx。与常规 RL 算法相比,GFlowNets 在模式发现方面表现更优,这对于药物发现和组合搜索等应用非常有用。然而,由于 GFlowNets 是相对较新的算法类别,RL 中许多有用的技术尚未与之结合。本文中,我们研究了重放缓冲在 GFlowNets 中的利用。我们通过经验探索了多种重放缓冲采样技术,并评估了其对模式发现速度及所发现模式质量的影响。我们在 Hypergrid 玩具域和分子合成环境中的实验结果表明,与使用在线策略生成的轨迹训练相比,使用重放缓冲训练在模式发现上有显著提升。

关键词

引用

@article{arxiv.2307.07674,
  title  = {An Empirical Study of the Effectiveness of Using a Replay Buffer on Mode Discovery in GFlowNets},
  author = {Nikhil Vemgal and Elaine Lau and Doina Precup},
  journal= {arXiv preprint arXiv:2307.07674},
  year   = {2023}
}

备注

Accepted to ICML 2023 workshop on Structured Probabilistic Inference & Generative Modeling