中文

可分解动作空间中离线强化学习的研究

机器学习 2024-11-19 v1 机器学习

摘要

将强化学习 (RL) 扩展到离线领域产生了广阔的前景,特别是在数据收集带来重大挑战或风险的领域。将 RL 转移到离线设置成功的关键在于,缓解对数据中缺失的状态-动作对的价值估计中的过高估计偏差。尽管近年来提出了许多方法,但这些方法主要集中在连续或小规模离散动作空间上。另一方面,可分解的离散动作空间受到的关注相对较少,尽管许多现实世界问题天然具有可分解的动作。在这项工作中,我们对可分解动作空间中的离线强化学习进行了基础性研究。以 DecQN 中阐述的价值分解为基础,我们提出了可分解方法的方案,并对适应于可分解设置的几种离线技术进行了广泛的实证评估。在缺乏既定基准的情况下,我们引入了一套自己的基准,包含不同数据质量和任务复杂度的数据集。为了倡导可复现的研究和创新,我们将所有数据集与代码库一起公开供公众使用。

关键词

引用

@article{arxiv.2411.11088,
  title  = {An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces},
  author = {Alex Beeson and David Ireland and Giovanni Montana},
  journal= {arXiv preprint arXiv:2411.11088},
  year   = {2024}
}

备注

Published in Transactions on Machine Learning Research (11/2024)