中文

模型失配下的强化学习

机器学习 2017-11-10 v2 机器学习

摘要

我们研究模型误设下的强化学习,即我们无法访问真实环境,只能访问其一个合理近似的环境。我们通过将鲁棒 MDP 框架扩展到无模型强化学习设置来解决此问题,在该设置中我们无法访问模型参数,只能从中采样状态。我们定义了 Q-learning、SARSA 和 TD-learning 的鲁棒版本,并分别证明了它们收敛到近似最优鲁棒策略和近似值函数。我们通过函数近似将鲁棒算法扩展到大规模 MDP,并在两种不同设置下证明了收敛性。我们证明了线性架构下(在温和假设下)鲁棒近似策略迭代和鲁棒近似值迭代的收敛性。我们还定义了一个鲁棒损失函数——均方鲁棒投影贝尔曼误差,并给出了保证收敛到局部极小值的随机梯度下降算法。

关键词

引用

@article{arxiv.1706.04711,
  title  = {Reinforcement Learning under Model Mismatch},
  author = {Aurko Roy and Huan Xu and Sebastian Pokutta},
  journal= {arXiv preprint arXiv:1706.04711},
  year   = {2017}
}

备注

To appear in Proceedings of NIPS 2017