中文

基于模型的强化学习中对抗复合误差的学习方法

机器学习 2019-12-25 v1 机器学习

摘要

尽管基于模型的强化学习相比无模型方法有望改善样本复杂度,但如果模型不准确,它可能灾难性地失败。理想情况下,算法应能在合理长的规划时域内信任不完美模型,并仅在模型误差变得不可行地大时才依赖无模型更新。本文中,我们研究基于状态依赖基础选择规划时域的技术,其中状态的规划时域由该状态周围的最大累积模型误差决定。我们证明这些状态依赖的模型误差可通过时序差分方法学习,基于一种将累积模型误差进行时间分解的新方法。实验结果表明,所提方法能成功调整规划时域以考虑状态依赖的模型精度,相比基于模型和无模型基线显著提高了策略学习效率。

关键词

引用

@article{arxiv.1912.11206,
  title  = {Learning to Combat Compounding-Error in Model-Based Reinforcement Learning},
  author = {Chenjun Xiao and Yifan Wu and Chen Ma and Dale Schuurmans and Martin Müller},
  journal= {arXiv preprint arXiv:1912.11206},
  year   = {2019}
}