中文

生成流网络的预训练与微调

机器学习 2023-10-06 v1 人工智能

摘要

生成流网络(GFlowNets)是一种摊销采样器,学习随机策略以从给定的非归一化奖励分布中顺序生成组合对象。它们能生成多样化高奖励对象,这在科学发现任务中是一个重要考量。然而,由于它们通常从给定的外在奖励函数训练,如何利用预训练能力并以无监督方式训练 GFlowNets 以高效适应下游任务仍是一个重要的开放挑战。受近期无监督预训练在各领域成功的启发,我们引入一种用于 GFlowNets 无奖励预训练的新方法。通过将训练构建为自监督问题,我们提出一种结果条件化 GFlowNet(OC-GFN),学习探索候选空间。具体而言,OC-GFN 学习到达任意目标结果,类似于强化学习中的目标条件化策略。我们表明预训练的 OC-GFN 模型可直接提取出能在下游任务中从任意新奖励函数采样的策略。尽管如此,在下游任务特定奖励上适配 OC-GFN 涉及对可能结果的难解边际化。我们提出一种通过学习的摊销预测器来近似该边际化的新方法,从而实现高效微调。大量实验结果验证了我们的方法有效性,展示了 OC-GFN 预训练的效果及其快速适应下游任务和更高效发现模式的能力。本工作可作为在 GFlowNets 背景下进一步探索预训练策略的基础。

关键词

引用

@article{arxiv.2310.03419,
  title  = {Pre-Training and Fine-Tuning Generative Flow Networks},
  author = {Ling Pan and Moksh Jain and Kanika Madan and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2310.03419},
  year   = {2023}
}