中文

梯度提升强化学习

机器学习 2025-10-21 v2 人工智能

摘要

我们提出了梯度提升强化学习(Gradient Boosting Reinforcement Learning, GBRL),这是一个将梯度提升树(GBT)的优势应用于强化学习(RL)任务的框架。尽管神经网络(NN)已成为RL的事实标准,然而它们在处理结构化和分类特征方面面临诸多挑战,并且倾向于对分布外样本的泛化能力较差。这些正是GBT在监督学习中长期优势领域的挑战。然而,GBT在RL中的应用仍受限。传统GBT库的设计针对的是静态数据集和固定标签,与RL的动态特性不符——在训练期间,状态分布和奖励信号都会发生变化。GBRL通过持续对树构建与环境交互进行交错,克服了这一限制。通过大量实验,我们展示了GBRL在结构化观测和分类特征域中超越NN的表现,同时在标准连续控制基准测试中保持竞争性能。与其监督学习对应一样,GBRL在分布外样本方面表现出色,更好地处理不规则的状态-动作关系。

关键词

引用

@article{arxiv.2407.08250,
  title  = {Gradient Boosting Reinforcement Learning},
  author = {Benjamin Fuhrer and Chen Tessler and Gal Dalal},
  journal= {arXiv preprint arXiv:2407.08250},
  year   = {2025}
}

备注

to be published in the Forty-Second International Conference on Machine Learning