中文

平均奖赏无模型强化学习:系统性综述与文献图谱

机器学习 2021-08-04 v2 人工智能

摘要

强化学习是人工智能的重要部分。在本文中,我们综述了在无限时域设定下利用平均奖赏最优准则的无模型强化学习。受Mahadevan(1996a)的独立综述启发,我们提供了该领域工作的更新综述,并将其扩展以涵盖策略迭代和函数近似方法(除值迭代和表格对应方法之外)。我们给出了全面的文献图谱。我们还识别并讨论了未来工作的机会。

关键词

引用

@article{arxiv.2010.08920,
  title  = {Average-reward model-free reinforcement learning: a systematic review and literature mapping},
  author = {Vektor Dewanto and George Dunn and Ali Eshragh and Marcus Gallagher and Fred Roosta},
  journal= {arXiv preprint arXiv:2010.08920},
  year   = {2021}
}

备注

36 pages, refined prelim and politer sections