中文

无真实世界反馈的 PAC 强化学习

机器学习 2019-10-28 v3 机器学习

摘要

本工作研究 Sim-to-Real 设定下的强化学习,其中智能体先在若干模拟器上训练,再部署到真实世界中,旨在降低真实世界的样本复杂度需求。利用称为富观测马尔可夫决策过程(ROMDP) 的动态模型,我们在真实世界不可获得反馈的情形下建立了 Sim-to-Real 的理论框架。我们给出了真实世界样本复杂度的保证,其小于当前已知的直接在真实世界(即无模拟器访问)带反馈学习 ROMDP 的复杂度。

关键词

引用

@article{arxiv.1909.10449,
  title  = {PAC Reinforcement Learning without Real-World Feedback},
  author = {Yuren Zhong and Aniket Anand Deshmukh and Clayton Scott},
  journal= {arXiv preprint arXiv:1909.10449},
  year   = {2019}
}