离屏 RL 算法可通过样本多次复用实现连续控制的样本高效性
机器学习
2023-05-31 v1
摘要
样本效率是在线强化学习(RL)最关键的问题之一。现有方法通过采用基于模型的方法、Q-集成或更好的探索机制来实现更高的样本效率。我们则提出通过对固定采样批次多次更新来训练离屏 RL 智能体,从而复用这些样本并在单个优化循环内更好地利用它们。我们将该方法命名为样本多次复用(SMR)。我们从理论上展示了带 SMR 的 Q-learning 的性质,例如收敛性。此外,我们将 SMR 与现成的离屏 RL 算法结合,并在多种连续控制基准上进行了实验。实证结果表明,SMR 在大多数评估任务中显著提升了基础方法的样本效率,且无需任何超参数调优或额外技巧。
引用
@article{arxiv.2305.18443,
title = {Off-Policy RL Algorithms Can be Sample-Efficient for Continuous Control via Sample Multiple Reuse},
author = {Jiafei Lyu and Le Wan and Zongqing Lu and Xiu Li},
journal= {arXiv preprint arXiv:2305.18443},
year = {2023}
}
备注
37 pages