GFlowNets 的悲观逆向策略
机器学习
2024-10-30 v3
摘要
本文研究了通过状态转换轨迹来学习给定奖励函数比例采样对象的生成流网络(GFlowNets)。在本工作中,我们观察到GFlowNets由于在不足的轨迹数量上进行训练,倾向于低效利用高奖励对象,这可能导致估计流值与已知奖励值之间存在较大差距。为应对这一挑战,我们提出了GFlowNets的悲观逆向策略(PBP-GFN),该策略最大化观察到的流值,以与对象的真实奖励密切对齐。我们在八个基准测试中广泛评估了PBP-GFN,包括超网格环境、袋子生成、结构化集生成、分子生成和四个RNA序列生成任务。特别是,PBP-GFN增强了高奖励对象的发现,保持了对象的多样性,并在所有方法中持续实现优异性能。
引用
@article{arxiv.2405.16012,
title = {Pessimistic Backward Policy for GFlowNets},
author = {Hyosoon Jang and Yunhui Jang and Minsu Kim and Jinkyoo Park and Sungsoo Ahn},
journal= {arXiv preprint arXiv:2405.16012},
year = {2024}
}