中文

利用全可观测策略在部分可观测下进行学习

机器人学 2022-11-11 v2 机器学习

摘要

在部分可观测域中的强化学习由于缺少可观测状态信息而具有挑战性。幸运的是,在此类状态信息的模拟器中离线学习通常是可行的。特别地,我们提出一种部分可观测强化学习方法,该方法在离线训练期间使用全可观测策略(我们称之为状态专家)以提升在线表现。基于 Soft Actor-Critic (SAC),我们的智能体在执行类似于状态专家的动作与在部分可观测下获取高回报之间取得平衡。我们的方法可利用全可观测策略进行探索以及用于域中全可观测的部分,同时仍能在部分可观测下学习。在六个机器人域中,我们的方法优于纯模仿、纯强化学习、两类方法的串行或并行组合,以及同一设定下近期的最先进方法。在从像素进行的操作任务中向物理机器人的成功策略迁移,展示了我们的方法在部分可观测下学习有趣策略的实用性。

关键词

引用

@article{arxiv.2211.01991,
  title  = {Leveraging Fully Observable Policies for Learning under Partial Observability},
  author = {Hai Nguyen and Andrea Baisero and Dian Wang and Christopher Amato and Robert Platt},
  journal= {arXiv preprint arXiv:2211.01991},
  year   = {2022}
}

备注

Accepted at the 2022 Conference on Robot Learning (CoRL), Auckland, New Zealand