保序 GFlowNets
机器学习
2024-02-27 v2 人工智能
机器学习
摘要
生成流网络(GFlowNets)已被提出作为一种方法,用以采样一组多样化的候选对象,其概率与给定奖励成正比。然而,GFlowNets 只能与预定义的标量奖励一起使用,这在计算上可能代价高昂,或者在多目标优化(MOO)任务等情况下无法直接获取。此外,为优先识别高奖励候选对象,通常的做法是将奖励提升到更高的指数,其最优选择可能因不同环境而异。为解决这些问题,我们提出保序 GFlowNets(OP-GFNs),其采样概率与学习到的奖励函数成正比,该函数与候选对象上提供的(部分)序一致,从而消除了对奖励函数显式表述的需求。我们从理论上证明,OP-GFNs 的训练过程在单目标最大化任务中逐渐稀疏化学习到的奖励地形。该稀疏化集中于序中较高层级的候选对象,确保训练初期的探索与训练末期的利用。我们在单目标最大化(全序)和多目标帕累托前沿逼近(偏序)任务中展示了 OP-GFN 的顶尖性能,包括合成数据集、分子生成和神经网络架构搜索。
引用
@article{arxiv.2310.00386,
title = {Order-Preserving GFlowNets},
author = {Yihang Chen and Lukas Mauch},
journal= {arXiv preprint arXiv:2310.00386},
year = {2024}
}
备注
ICLR 2024