随机策略评估揭示生成流网络的策略
机器学习
2025-06-03 v3
摘要
生成流网络 (GFlowNet) 是一种概率框架,其中智能体学习随机策略和 flow 函数来按比例从未归一化奖励函数中抽样对象。近期多个研究探索了 GFlowNets 与最大熵 (MaxEnt) 强化学习之间的联系,这会通过学习熵正则化目标来修改强化学习智能体的标准目标。然而,GFlowNets 与标准强化学习之间的关系仍基本未被探索,尽管二者在顺序决策方面具有内在相似性。虽然 GFlowNets 可以通过专门的 flow-matching 目标发现多样化的解决方案,但将其连接起来可以通过 established 的 RL 原则简化其实现并提高 RL 的 diverse solution discovery 能力。在本文中,我们通过揭示 GFlowNets 与一个 RL 最基本组件 — 策略评估之间的根本联系来弥合这一差距。意外地,我们发现通过在 certain 结构条件下评估 uniform policy (均匀策略) 获取的值函数与 GFlowNets 中的 flow 函数密切相关。基于这些见解,我们引入了一个校正后的随机策略评估 (RPE) 算法,仅通过在这些情况下评估固定随机策略即可实现与 GFlowNets 相同的 reward-matching 效果,提供了新的视角。广泛的基准实验结果表明,RPE 在与先前方法相比取得竟争性的结果,为 (非 MaxEnt) RL 与 GFlowNets 之间的关系提供了新的理解。
引用
@article{arxiv.2406.02213,
title = {Random Policy Evaluation Uncovers Policies of Generative Flow Networks},
author = {Haoran He and Emmanuel Bengio and Qingpeng Cai and Ling Pan},
journal= {arXiv preprint arXiv:2406.02213},
year = {2025}
}