学习缩放Logits用于温度条件GFlowNets
机器学习
2024-06-04 v3 机器学习
摘要
GFlowNets是通过随机策略顺序生成组合结构的概率模型。在GFlowNets中,温度条件GFlowNets可引入基于温度的可控性以平衡探索与利用。我们提出Logit-scaling GFlowNets(Logit-GFN),一种极大加速温度条件GFlowNets训练的新型架构设计。其基于如下思想:先前提出的方法在深度网络训练中引入了数值挑战,因为不同温度可能产生差异很大的梯度分布以及策略logits的幅度。我们发现,若直接使用温度的习得函数对策略的logits进行缩放,该挑战可大幅缓解。此外,使用Logit-GFN,GFlowNets可凭借在离线学习中更好的泛化能力以及在在线学习中更好的模式发现能力得到改进,这在各类生物与化学任务中得到了实证验证。我们的代码可在https://github.com/dbsxodud-11/logit-gfn获取。
引用
@article{arxiv.2310.02823,
title = {Learning to Scale Logits for Temperature-Conditional GFlowNets},
author = {Minsu Kim and Joohwan Ko and Taeyoung Yun and Dinghuai Zhang and Ling Pan and Woochang Kim and Jinkyoo Park and Emmanuel Bengio and Yoshua Bengio},
journal= {arXiv preprint arXiv:2310.02823},
year = {2024}
}
备注
ICML 2024, 23 pages, 21 figures