中文

相对轨迹平衡等价于 Trust-PCL

机器学习 2025-09-03 v1

摘要

近期的生成模型进展突显了强化学习 (RL) 在微调中的重要性,特别是 KL 正则化方法在自回归模型和扩散模型中证明效果极佳。补充这一研究路径,相对轨迹平衡 (RTB) 目标 recently 引入于生成流网络 (GFlowNets) 的背景中,以 serve 相同角色于顺序生成模型。基于此前工作将 GFlowNets 与最大熵 RL 联系起来的研究,我们在本文中在理论上建立了 RTB 与 Trust-PCL——一种具有 KL 正则化的 off-policy RL 方法——之间的等价性。这一等价性将 RTB 置于 KL 正则化 RL 更广阔的理论视野中,并阐明其与先前方法的关系。借助这一洞见,我们重访 RTB 论文中的一个示例性案例,表明 KL 正则化 RL 方法可实现相当性能,提供了一种与之前报告的不同视角。

关键词

引用

@article{arxiv.2509.01632,
  title  = {Relative Trajectory Balance is equivalent to Trust-PCL},
  author = {Tristan Deleu and Padideh Nouri and Yoshua Bengio and Doina Precup},
  journal= {arXiv preprint arXiv:2509.01632},
  year   = {2025}
}