中文

DNA:基于双网络架构的近端策略优化

机器学习 2022-11-15 v2 人工智能

摘要

本文探讨了在深度 actor-critic 强化学习模型中同时学习价值函数与策略的问题。我们发现,由于这两项任务在噪声水平上存在一个数量级的差异,通常联合学习这些函数的做法并非最优。相反,我们表明,独立学习这些任务但辅以受限蒸馏阶段,可显著提升性能。此外,我们发现策略梯度噪声水平可通过使用更低方差的回报估计来降低,而价值学习噪声水平则随更低偏差的估计而减小。这些见解共同催生了我们对近端策略优化(Proximal Policy Optimization)的扩展,称之为双网络架构(Dual Network Architecture, DNA),其性能显著优于其前身。即使在更困难的随机控制设置下,DNA 在测试的五个环境中的四个上也超越了流行的 Rainbow DQN 算法的表现。

关键词

引用

@article{arxiv.2206.10027,
  title  = {DNA: Proximal Policy Optimization with a Dual Network Architecture},
  author = {Matthew Aitchison and Penny Sweetser},
  journal= {arXiv preprint arXiv:2206.10027},
  year   = {2022}
}

备注

Published at NeurIPS 2022