中文

用决策树回归解决离线强化学习

机器学习 2024-10-16 v2 系统与控制 系统与控制

摘要

本研究提出了一种解决离线强化学习问题的新方法,通过将其重新表述为可以使用决策树有效解决的回归任务。具体而言,我们引入了两种不同的框架:返回条件决策树策略和返回加权决策树策略,两者在智能体训练和推理中均实现了显著的速度,训练通常只需几分钟。尽管这种重新表述的方法简化了离线强化学习,但我们的智能体表现至少与已有方法相当。我们在D4RL数据集上评估了我们的方法,涉及运动、操作以及其他涉及轮式和飞行机器人的机器人任务。此外,我们评估了在延迟/稀疏奖励场景中的性能,并通过动作分布和特征重要性突出了这些策略的可解释性。

关键词

引用

@article{arxiv.2401.11630,
  title  = {Solving Offline Reinforcement Learning with Decision Tree Regression},
  author = {Prajwal Koirala and Cody Fleming},
  journal= {arXiv preprint arXiv:2401.11630},
  year   = {2024}
}