中文

基于树扩展的策略梯度

机器学习 2025-05-27 v2 人工智能

摘要

策略梯度方法以高方差和高样本复杂度而著称。为缓解此问题,我们引入 SoftTreeMax——一种采用规划的 softmax 推广。在 SoftTreeMax 中,我们用多步折扣累积奖励扩展传统 logits,并在其上叠加未来状态的 logits。我们分析了 SoftTreeMax 并解释了树扩展如何有助于降低其梯度方差。我们证明该方差依赖于所选择的树扩展策略。具体而言,我们表明所诱导的转移越接近状态无关,方差衰减越强。对于近似前向模型,我们证明由此产生的梯度偏差随近似误差减小,同时保持相同的方差缩减。我们的结果是首个对近似模型的梯度偏差进行界定的工作。在 SoftTreeMax 的实际实现中,我们利用基于 GPU 的并行模拟器进行快速高效的树扩展。在 Atari 中使用该实现,我们表明 SoftTreeMax 将梯度方差降低了三个数量级。与分布式 PPO 相比,这带来了更好的样本复杂度与改进的性能。

关键词

引用

@article{arxiv.2301.13236,
  title  = {Policy Gradient with Tree Expansion},
  author = {Gal Dalal and Assaf Hallak and Gugan Thoppe and Shie Mannor and Gal Chechik},
  journal= {arXiv preprint arXiv:2301.13236},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2209.13966