中文

从部分剧集评估 GFlowNet 以实现稳定和灵活的基于策略训练

机器学习 2026-03-03 v1 机器学习

摘要

生成流网络 (GFlowNets) 用于学习策略,以高效地对组合候选对象进行采样,将其生成过程解释为有向无环图中轨迹。在基于价值的方法中,目标是强制在部分剧集之间保持流量,使得学习策略的流量与所需策略的估计流量平衡,从而隐式鼓励策略差异最小化。基于策略的方法在估计差异方面交替进行估计和更新策略,但在有向无环图下可靠地估计差异仍是一个主要挑战。本工作通过表明流量平衡也产生了衡量差异的原则性策略评估器,并提出用于学习评估器的部分剧集评估平衡目标。在合成任务和真实任务上所示的演示表明,评估平衡不仅强化了基于策略训练的可靠性,还通过无缝支持参数化反向策略并实现离线数据收集技术的集成,扩展了其灵活性。

关键词

引用

@article{arxiv.2603.01047,
  title  = {Evaluating GFlowNet from partial episodes for stable and flexible policy-based training},
  author = {Puhua Niu and Shili Wu and Xiaoning Qian},
  journal= {arXiv preprint arXiv:2603.01047},
  year   = {2026}
}

备注

Accepted by ICLR 2026