轨迹平衡:GFlowNets 中改进的信用分配
机器学习
2023-10-05 v3 机器学习
摘要
生成流网络是一种通过动作序列从给定非归一化密度中学习随机策略以生成组合对象(如图或字符串)的方法,其中许多可能的动作序列可以生成同一个对象。我们发现先前提出的 GFlowNets 学习目标(流匹配和详细平衡,类似于时序差分学习)在长动作序列中容易出现低效的信用传播。因此,我们为 GFlowNets 提出了一种新的学习目标——轨迹平衡,作为对先前使用目标的更高效替代。我们证明,轨迹平衡目标的任何全局最小化器都可以定义一个从目标分布中精确采样的策略。在四个不同领域的实验中,我们实证展示了轨迹平衡目标对 GFlowNet 收敛性、生成样本多样性以及对长动作序列和大型动作空间鲁棒性的益处。
引用
@article{arxiv.2201.13259,
title = {Trajectory balance: Improved credit assignment in GFlowNets},
author = {Nikolay Malkin and Moksh Jain and Emmanuel Bengio and Chen Sun and Yoshua Bengio},
journal= {arXiv preprint arXiv:2201.13259},
year = {2023}
}
备注
NeurIPS 2022; see footnotes for code; v3 fixes minor errata