计划增强抽样与早期引导:高奖励发现
机器学习
2026-02-03 v3 人工智能
摘要
生成流网络(GFlowNets)实现具有内在多样性的结构化生成,但现有抽样策略常依赖于弱的引导探索,减缓了对高奖励候选者的早期发现。在分子设计等任务中,快速且持续地生成高奖励解答往往优于忠实的分布匹配。我们提出了一种计划增强框架,其中使用基于多项式上置信界(UCB)的蒙特卡洛树搜索(MCTS)提供在线价值估计,柔性-贪心机制可控地将这些计划信号整合到 GFlowNets 的前向策略中。该设计促进了对高奖励轨迹的早期探索,并在经验积累的过程中逐渐转向基于策略的开发。实验结果表明,我们的方法加速了早期高奖励发现,保持了顶质量样本的生成,同时在代表性任务中保持了多样性。所有实现均已在 https://github.com/ZRNB/PLUS 提供。
引用
@article{arxiv.2510.00805,
title = {Planning-Augmented Sampling with Early Guidance for High-Reward Discovery},
author = {Rui Zhu and Yudong Zhang and Xuan Yu and Chen Zhang and Xu Wang and Yang Wang},
journal= {arXiv preprint arXiv:2510.00805},
year = {2026}
}