用决策树回归解决离线强化学习
机器学习
2024-10-16 v2 系统与控制
系统与控制
摘要
本研究提出了一种解决离线强化学习问题的新方法,通过将其重新表述为可以使用决策树有效解决的回归任务。具体而言,我们引入了两种不同的框架:返回条件决策树策略和返回加权决策树策略,两者在智能体训练和推理中均实现了显著的速度,训练通常只需几分钟。尽管这种重新表述的方法简化了离线强化学习,但我们的智能体表现至少与已有方法相当。我们在D4RL数据集上评估了我们的方法,涉及运动、操作以及其他涉及轮式和飞行机器人的机器人任务。此外,我们评估了在延迟/稀疏奖励场景中的性能,并通过动作分布和特征重要性突出了这些策略的可解释性。
引用
@article{arxiv.2401.11630,
title = {Solving Offline Reinforcement Learning with Decision Tree Regression},
author = {Prajwal Koirala and Cody Fleming},
journal= {arXiv preprint arXiv:2401.11630},
year = {2024}
}