中文

用于改进 GFlowNets 探索的 Thompson 采样

机器学习 2023-07-03 v1

摘要

生成流网络(GFlowNets)是一种摊销变分推断算法,将来自组合对象分布的采样视为带有可学习动作策略的序贯决策问题。不同于优化变分界的其他分层采样算法,GFlowNet 算法可稳定地离策运行,这有利于发现目标分布的模式。尽管行为策略的选择具有此种灵活性,高效选取训练轨迹的最优方式尚未被系统探索。在本文中,我们将训练轨迹的选择视为主动学习问题,并采用受多臂老虎机方法启发的贝叶斯技术来处理。所提算法 Thompson 采样 GFlowNets(TS-GFN)维持关于策略的近似后验分布,并从此后验中采样轨迹用于训练。我们在两个领域中展示 TS-GFN 相较既往工作的离策探索策略实现了改进的探索,从而更快收敛至目标分布。

关键词

引用

@article{arxiv.2306.17693,
  title  = {Thompson sampling for improved exploration in GFlowNets},
  author = {Jarrid Rector-Brooks and Kanika Madan and Moksh Jain and Maksym Korablyov and Cheng-Hao Liu and Sarath Chandar and Nikolay Malkin and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2306.17693},
  year   = {2023}
}

备注

Structured Probabilistic Inference and Generative Modeling (SPIGM) workshop @ ICML 2023