无真实世界反馈的 PAC 强化学习
机器学习
2019-10-28 v3 机器学习
摘要
本工作研究 Sim-to-Real 设定下的强化学习,其中智能体先在若干模拟器上训练,再部署到真实世界中,旨在降低真实世界的样本复杂度需求。利用称为富观测马尔可夫决策过程(ROMDP) 的动态模型,我们在真实世界不可获得反馈的情形下建立了 Sim-to-Real 的理论框架。我们给出了真实世界样本复杂度的保证,其小于当前已知的直接在真实世界(即无模拟器访问)带反馈学习 ROMDP 的复杂度。
引用
@article{arxiv.1909.10449,
title = {PAC Reinforcement Learning without Real-World Feedback},
author = {Yuren Zhong and Aniket Anand Deshmukh and Clayton Scott},
journal= {arXiv preprint arXiv:1909.10449},
year = {2019}
}