QGFN:利用动作值实现可控的贪婪性
机器学习
2024-11-04 v3
摘要
生成流网络(GFlowNets; GFNs)是一类基于能量的组合对象生成方法,能够生成多样且高价值的样本。然而,持续地使 GFN 偏向于产生高价值样本并非易事。在这项工作中,我们利用 GFN 与强化学习(RL)之间的联系,提出将 GFN 策略与动作值估计 相结合,以创建可通过混合参数控制的更贪婪的采样策略。我们展示了所提出方法 QGFN 的几种变体,能够在各种任务中提高生成的高奖励样本数量,同时不牺牲多样性。
引用
@article{arxiv.2402.05234,
title = {QGFN: Controllable Greediness with Action Values},
author = {Elaine Lau and Stephen Zhewen Lu and Ling Pan and Doina Precup and Emmanuel Bengio},
journal= {arXiv preprint arXiv:2402.05234},
year = {2024}
}
备注
Accepted by 38th Conference on Neural Information Processing Systems (NeurIPS 2024)