通过马尔可夫链视角控制 GFlowNets 的探索-利用权衡
人工智能
2026-02-27 v3 机器学习
摘要
生成流网络(GFlowNet)目标在隐式上固定前向和后向策略之间的等比混合,可能限制训练期间的探索-利用权衡。在进一步探索GFlowNets与马尔可夫链之间的关系后,我们在理论上建立了GFlowNet目标与马尔可夫链可逆性之间的等价性,从而揭示了此类约束的来源,并为将马尔可夫链属性适用于GFlowNets提供了框架。基于这些理论发现,我们提出了-GFNs,通过可调参数对混合方式进行一般化。这种一般化使我们能够直接控制探索-利用动力学以增强模式发现能力,同时确保收敛于唯一流。在包括集合、位序列和分子生成等多个基准测试上,-GFN目标持续优于先前的GFlowNet目标,在发现模式数量上提升了最高可达。
引用
@article{arxiv.2602.01749,
title = {Controlling Exploration-Exploitation in GFlowNets via Markov Chain Perspectives},
author = {Lin Chen and Samuel Drapeau and Fanghao Shao and Xuekai Zhu and Bo Xue and Yunchong Song and Mathieu Laurière and Zhouhan Lin},
journal= {arXiv preprint arXiv:2602.01749},
year = {2026}
}