中文

度量空间中基于核的非平稳强化学习方法

机器学习 2022-03-25 v2 机器学习

摘要

在这项工作中,我们提出KeRNS:一种用于非平稳马尔可夫决策过程(MDP)中情节式强化学习的算法,其状态-动作集赋予了一个度量。利用由时间相关核构建的MDP非参数模型,我们证明了一个后悔界,该界随状态-动作空间的覆盖维数以及MDP随时间的全变分(量化其非平稳程度)而缩放。我们的方法推广了先前基于滑动窗口和指数折扣来处理变化环境的方法。我们进一步提出了KeRNS的实用实现,分析了其后悔并进行了实验验证。

关键词

引用

@article{arxiv.2007.05078,
  title  = {A Kernel-Based Approach to Non-Stationary Reinforcement Learning in Metric Spaces},
  author = {Omar Darwiche Domingues and Pierre Ménard and Matteo Pirotta and Emilie Kaufmann and Michal Valko},
  journal= {arXiv preprint arXiv:2007.05078},
  year   = {2022}
}

备注

Update following the publication in AISTATS 2021. Fixed typos and lemma about runtime