GFlowNets 中的动态回溯:利用依赖奖励的调整机制增强决策步骤
机器学习
2025-03-21 v6
摘要
生成流网络(GFlowNets 或 GFNs)是基于马尔可夫流的概率模型,它们采用特定的摊销算法来学习随机策略,以生成包括生物分子、化学材料等在内的组合物质。凭借生成高性能生化分子的强大能力,GFNs 加速了科学物质的发现,有效克服了传统材料发现方法耗时、费力且成本高昂的缺点。然而,以往的研究很少关注通过调整生成结构来积累探索经验,这导致在复杂的采样空间中迷失方向。为解决此问题所做的努力(如 LS-GFN)仅局限于局部贪心搜索,缺乏更广泛的全局调整。本文引入了 GFNs 的一种新变体——动态回溯 GFN(DB-GFN),它通过基于奖励的动态回溯机制提高了决策步骤的适应性。DB-GFN 允许在网络构建过程中根据当前状态的奖励值进行回溯,从而在探索过程中纠正不利决策并探索替代路径。在应用于涉及生化分子和遗传物质序列的生成任务时,DB-GFN 在样本质量、样本探索数量和训练收敛速度方面均优于 LS-GFN 和 GTB 等 GFN 模型以及传统的强化学习方法。此外,由于其正交性质,DB-GFN 在未来改进 GFNs 方面展现出巨大潜力,并且可以与其他策略集成以实现更高的搜索性能。
引用
@article{arxiv.2404.05576,
title = {Dynamic Backtracking in GFlowNets: Enhancing Decision Steps with Reward-Dependent Adjustment Mechanisms},
author = {Shuai Guo and Jielei Chu and Lin Ma and Zhaoyu Li and Tianrui Li},
journal= {arXiv preprint arXiv:2404.05576},
year = {2025}
}