中文

部分可观测性下的无偏非对称强化学习

机器学习 2022-08-08 v2 人工智能

摘要

在部分可观测强化学习中,离线训练可获取在线训练和/或执行时不可用的潜在信息,例如系统状态。非对称 actor-critic 方法通过基于状态的评论家训练基于历史的策略来利用此类信息。然而,许多非对称方法缺乏理论基础,且仅在有限领域上评估。我们考察了使用基于状态评论家的非对称 actor-critic 方法的理论,揭示了破坏一种常见变体有效性并限制其处理部分可观测性能力的根本问题。我们提出了一种无偏非对称 actor-critic 变体,能够在保持理论严谨、维持策略梯度定理有效性的同时利用状态信息,且不为训练过程引入偏差和相对较低的方差。在表现出显著部分可观测性的领域上进行的实证评估证实了我们的分析,表明无偏非对称 actor-critic 比对称和有偏非对称基线收敛到更优策略和/或更快。

关键词

引用

@article{arxiv.2105.11674,
  title  = {Unbiased Asymmetric Reinforcement Learning under Partial Observability},
  author = {Andrea Baisero and Christopher Amato},
  journal= {arXiv preprint arXiv:2105.11674},
  year   = {2022}
}