中文

绕过你知道的做法:GFlowNets 的发生轨迹均衡

机器学习 2026-02-23 v1 机器学习

摘要

生成流网络(GFlowNets)是一族灵活的折扣采样器,训练目标是按奖励函数比例生成离散和可组合对象。然而,学习效率受限于模型在训练期间快速探索多样化高概率区域的能力。为缓解此问题,近期工作聚焦通过好奇心驱动搜索和自监督随机网络提取,鼓励探索未访问且高价值的状态,却倾向于在已被良好近似的区域浪费样本。为此,本文提出自适应互补探索(ACE),一种原则化的算法,用于在学习GFlowNets时有效地探索新颖且高概率的区域。ACE引入一个显式训练的探索GFlowNet,专门寻找由标准GFlowNet未充分探索的区域中高奖励状态。通过大量实验,我们展示ACE在目标分布的逼近精度以及发现多样化高奖励状态的速度方面显著优于先前工作。

关键词

引用

@article{arxiv.2602.17827,
  title  = {Avoid What You Know: Divergent Trajectory Balance for GFlowNets},
  author = {Pedro Dall'Antonia and Tiago da Silva and Daniel Csillag and Salem Lahlou and Diego Mesquita},
  journal= {arXiv preprint arXiv:2602.17827},
  year   = {2026}
}

备注

20 pages, under review