中文

超越代理模型:用于离线 GFlowNet 训练的轨迹蒸馏引导

机器学习 2026-05-26 v3 人工智能

摘要

生成式流网络(GFlowNets)擅长采样多样、高奖励的对象。在许多主动奖励查询不可行的实际应用中,这些模型必须使用静态离线数据集进行训练。主流的训练方法通常依赖代理模型为在线采样的轨迹提供奖励反馈。然而,由于数据稀缺或高评估成本,构建可靠的代理模型通常具有挑战性。虽然现有的无代理方法试图解决这个问题,但它们通常施加粗粒度约束,限制了模型有效探索的能力。为了克服这些局限性,我们提出了轨迹蒸馏 GFlowNet(TD-GFN),一种新颖的无代理训练框架。TD-GFN 利用逆向强化学习(IRL)从离线轨迹中提取密集的、转移级别的边奖励,为高效探索提供丰富的结构引导。至关重要的是,为了确保鲁棒性,这些奖励通过 DAG 剪枝和优先反向采样间接引导策略。这种设计确保梯度更新仅依赖于数据集的真实终端奖励,从而防止误差传播。实证结果表明,TD-GFN 在收敛速度和样本质量上均显著优于广泛的现有基线,为离线 GFlowNet 训练建立了一个更鲁棒、更高效的范式。

关键词

引用

@article{arxiv.2505.20110,
  title  = {Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training},
  author = {Ruishuo Chen and Xun Wang and Rui Hu and Zhuoran Li and Longbo Huang},
  journal= {arXiv preprint arXiv:2505.20110},
  year   = {2026}
}

备注

Camera-ready version accepted at ICML 2026