中文

关于多动作策略梯度

机器学习 2023-11-01 v5

摘要

我们研究了在每个状态具有多个动作样本的随机策略梯度(SPG)的方差。我们推导了多动作最优性条件,该条件决定了多动作 SPG 何时比具有按比例延长轨迹的单动作智能体产生更低的方差。我们提出了基于模型的多动作(MBMA)方法,该方法在 SPG 背景下利用动力学模型进行多动作采样。MBMA 解决了现有多动作 SPG 实现的相关问题,并且与从模型模拟 rollout 的状态估计的 SPG 相比,产生了更低的偏差和可比的方差。我们发现 MBMA 的偏差和方差结构符合理论预测。因此,与无模型、多动作以及基于模型的同策略 SPG 基线相比,MBMA 在一系列连续动作环境中实现了更高的样本效率和更高的回报。

关键词

引用

@article{arxiv.2210.13011,
  title  = {On Many-Actions Policy Gradient},
  author = {Michal Nauman and Marek Cygan},
  journal= {arXiv preprint arXiv:2210.13011},
  year   = {2023}
}

备注

ICML Proceedings 2023