中文

DoMo-AC:双重多步离屏策略Actor-Critic算法

机器学习 2023-05-31 v1

摘要

多步学习对多个时间步进行前向探索,在策略评估场景中已被证明极具价值。然而,在最优控制情形下,尽管已有若干前期工作,多步学习的影响仍相对有限。根本上,这可能是因为多步策略改进需要无法由随机样本近似的操作,从而阻碍了此类方法在实践中的广泛采用。为突破上述局限,我们提出双重多步离屏策略值迭代(DoMo-VI),一种结合多步策略改进与策略评估的新型预言算法。DoMo-VI享有向最优策略收敛速度提升的保证,并适用于一般离屏学习设置。我们进而提出双重多步离屏策略actor-critic(DoMo-AC),即DoMo-VI算法的实用实例化。DoMo-AC引入了偏差-方差权衡,确保改进的策略梯度估计。与IMPALA架构结合时,DoMo-AC在Atari-57游戏基准上较基线算法表现出提升。

关键词

引用

@article{arxiv.2305.18501,
  title  = {DoMo-AC: Doubly Multi-step Off-policy Actor-Critic Algorithm},
  author = {Yunhao Tang and Tadashi Kozuno and Mark Rowland and Anna Harutyunyan and Rémi Munos and Bernardo Ávila Pires and Michal Valko},
  journal= {arXiv preprint arXiv:2305.18501},
  year   = {2023}
}