经验研究:重放缓冲在 GFlowNets 模式发现中有效性的实证分析
机器学习
2023-07-19 v2
摘要
强化学习(RL)算法旨在通过迭代采样动作来学习最优策略,以学会如何最大化总期望回报 。GFlowNets 是一类特殊的算法,通过学习近似 比例采样的策略,从离散集合中生成多样化候选 。与常规 RL 算法相比,GFlowNets 在模式发现方面表现更优,这对于药物发现和组合搜索等应用非常有用。然而,由于 GFlowNets 是相对较新的算法类别,RL 中许多有用的技术尚未与之结合。本文中,我们研究了重放缓冲在 GFlowNets 中的利用。我们通过经验探索了多种重放缓冲采样技术,并评估了其对模式发现速度及所发现模式质量的影响。我们在 Hypergrid 玩具域和分子合成环境中的实验结果表明,与使用在线策略生成的轨迹训练相比,使用重放缓冲训练在模式发现上有显著提升。
引用
@article{arxiv.2307.07674,
title = {An Empirical Study of the Effectiveness of Using a Replay Buffer on Mode Discovery in GFlowNets},
author = {Nikhil Vemgal and Elaine Lau and Doina Precup},
journal= {arXiv preprint arXiv:2307.07674},
year = {2023}
}
备注
Accepted to ICML 2023 workshop on Structured Probabilistic Inference & Generative Modeling