具有高回放比和正则化的高效稀疏奖励目标条件强化学习
机器学习
2023-12-12 v1
摘要
具有高回放比(RR)和正则化的强化学习(RL)方法因其出色的样本效率而备受关注。然而,这些方法主要针对密集奖励任务开发。在本文中,我们旨在将这些 RL 方法扩展到稀疏奖励目标条件任务。我们使用随机集成双 Q 学习(REDQ)(Chen et al., 2021),一种具有高 RR 和正则化的 RL 方法。为了将 REDQ 应用于稀疏奖励目标条件任务,我们对其进行了以下修改:使用后见经验回放以及限定目标 Q 值。我们在 12 个机器人稀疏奖励目标条件任务(Plappert et al., 2018)上评估了经过这些修改的 REDQ,并表明其样本效率比先前最先进的 RL 方法好约 。此外,我们重新审视了 REDQ 特定组件的必要性,并通过移除不必要的组件对其进行简化。经过我们修改的简化 REDQ 在 4 个 Fetch 机器人任务中的样本效率比 SoTA 方法好约 。
引用
@article{arxiv.2312.05787,
title = {Efficient Sparse-Reward Goal-Conditioned Reinforcement Learning with a High Replay Ratio and Regularization},
author = {Takuya Hiraoka},
journal= {arXiv preprint arXiv:2312.05787},
year = {2023}
}
备注
Source code: https://github.com/TakuyaHiraoka/Efficient-SRGC-RL-with-a-High-RR-and-Regularization Demo video: https://drive.google.com/file/d/1UHd7JVPCwFLNFhy1QcycQfwU_nll_yII/view?usp=drive_link