中文

智能体能否类比学习?一种用于 PAC 强化学习的可推断模型

机器学习 2020-02-25 v3 机器学习

摘要

基于模型的强化学习算法通过构建并利用环境模型来做出决策。然而,现有算法均未尝试在充分遇见某一状态-动作对之前,从已知的状态-动作对推断其动态。我们提出一种称为贪心推断模型(Greedy Inference Model, GIM)的基于模型的新方法,该方法基于环境的内在谱特性从已知动态推断未知动态。换言之,GIM 能够“类比学习”。我们进一步引入一种新的探索策略,以确保智能体快速且均匀地访问未知的状态-动作对。GIM 比最先进的基于模型的算法在计算上高效得多,因为其动态规划操作次数与环境规模无关。在温和条件下,与不进行推断的方法相比,还能实现更低的样本复杂度。实验结果证明了 GIM 在多种真实世界任务中的有效性与高效性。

关键词

引用

@article{arxiv.1912.10329,
  title  = {Can Agents Learn by Analogy? An Inferable Model for PAC Reinforcement Learning},
  author = {Yanchao Sun and Furong Huang},
  journal= {arXiv preprint arXiv:1912.10329},
  year   = {2020}
}

备注

To be published in proceedings of AAMAS 2020