中文

Frugal Actor-Critic:利用独特经验的样本高效离策略深度强化学习

机器学习 2024-02-13 v1 人工智能 机器人学 系统与控制 系统与控制

摘要

在用于复杂动态系统无模型控制策略合成的离策略 Actor-Critic 强化学习(RL)算法中,回放缓冲区的高效利用起着重要作用。我们提出了一种实现样本效率的方法,侧重于在探索期间选择独特样本并将其加入回放缓冲区,旨在减小缓冲区大小并保持样本独立同分布(IID)的性质。我们的方法基于从初始随机探索阶段遇到的经验中选择状态变量集的重要子集,基于所选重要状态变量将状态空间划分为抽象状态集,最后使用核密度估计器选择具有独特状态-奖励组合的经验。我们形式化证明了结合所提独特经验积累方法的离策略 Actor-Critic 算法比原始离策略 Actor-Critic 算法收敛更快。此外,我们通过在 Gym 环境中可用的多个连续控制基准上与两种 SOTA Actor-Critic RL 算法进行比较来评估我们的方法。实验结果表明,与基线算法相比,我们的方法在所有基准上实现了回放缓冲区大小的显著减小,同时实现了更快的收敛或更好的奖励积累。

关键词

引用

@article{arxiv.2402.05963,
  title  = {Frugal Actor-Critic: Sample Efficient Off-Policy Deep Reinforcement Learning Using Unique Experiences},
  author = {Nikhil Kumar Singh and Indranil Saha},
  journal= {arXiv preprint arXiv:2402.05963},
  year   = {2024}
}