面向目标条件GFlowNets的逆向后综合
机器学习
2025-02-25 v2
摘要
生成流网络(GFlowNets)是一类新的概率采样器,已展现出生成多样化高奖励候选对象的卓越能力,与标准回报最大化方法(如强化学习)通常收敛于单个最优解不同。近期工作聚焦于开发目标条件GFlowNets,即训练单个GFlowNets以实现不同结果,以任务为准。然而,这些模型的训练面临稀疏奖励的重大挑战,尤其是在高维问题中。此外,先前方法受限于训练期间探索轨迹的覆盖范围,这在仅可获得离线数据时呈现更为突出的挑战。本文提出一种新方法,称为**逆向后综合**(**R**etrospective **B**ackward **S**ynthesis,**RBS**),以解决这些关键问题。具体而言,RBS 在目标条件GFlowNets中合成新的逆向轨迹,以丰富具有增强质量和多样性的训练轨迹,从而为有效解决稀疏奖励问题引入大量可学习信号。广泛的实验结果表明,我们的方法在样本效率上显著提升,并在各种标准评估基准上超越强大基线。
引用
@article{arxiv.2406.01150,
title = {Looking Backward: Retrospective Backward Synthesis for Goal-Conditioned GFlowNets},
author = {Haoran He and Can Chang and Huazhe Xu and Ling Pan},
journal= {arXiv preprint arXiv:2406.01150},
year = {2025}
}