中文

基于经验回放与动作离散度自适应的强化学习

机器学习 2022-08-02 v1

摘要

有效的强化学习需要在由动作分布离散度所定义的探索与利用之间取得恰当平衡。然而,这种平衡取决于任务、学习过程的当前阶段以及当前环境状态。现有指定动作分布离散度的方法需要依赖问题的超参数。本文中,我们提出使用如下原则自动指定动作分布离散度:该分布应具有足够的离散度以能够评估未来策略。为此,应将离散度调谐至确保回放缓冲区和生成这些动作的分布模态中的动作具有足够高的概率(密度),但不应更高。这样,可以基于缓冲区中的动作有效地评估策略,而当该策略收敛时动作中的探索性随机性减小。上述原则在具有挑战性的基准 Ant、HalfCheetah、Hopper 和 Walker2D 上得到了验证,并取得了良好结果。我们的方法使动作标准差收敛到与试错优化所得值相近的值。

关键词

引用

@article{arxiv.2208.00156,
  title  = {Reinforcement learning with experience replay and adaptation of action dispersion},
  author = {Paweł Wawrzyński and Wojciech Masarczyk and Mateusz Ostaszewski},
  journal= {arXiv preprint arXiv:2208.00156},
  year   = {2022}
}