中文

在 MuJoCo 环境中探索用于离散与连续控制任务的强化学习技术

机器学习 2023-07-24 v1 人工智能

摘要

我们利用快速物理模拟器 MuJoCo 在连续控制环境中运行任务,并揭示每个任务的观测空间、动作空间、奖励等细节。我们通过离散化方法比较 Q-learning 和 SARSA 来为连续控制基准基于值的方法,并将它们作为基线,逐步过渡到最先进的深度策略梯度方法之一 DDPG。在大量回合中,Q-learning 得分超过 SARSA,但 DDPG 在少量回合中优于两者。最后,我们也微调了模型超参数,期望以更少的时间和资源挤出更多性能。我们预期 DDPG 的新设计会大幅提升性能,然而仅在少数回合后,我们便能够获得不错的平均奖励。我们期望在给定充足时间和计算资源的情况下提升性能。

关键词

引用

@article{arxiv.2307.11166,
  title  = {Exploring reinforcement learning techniques for discrete and continuous control tasks in the MuJoCo environment},
  author = {Vaddadi Sai Rahul and Debajyoti Chakraborty},
  journal= {arXiv preprint arXiv:2307.11166},
  year   = {2023}
}

备注

Released @ Dec 2021. For associated project files, see https://github.com/chakrabortyde/mujoco-control-tasks