无限时域平均奖励马尔可夫决策过程中的无模型强化学习
机器学习
2020-02-26 v2 人工智能
机器学习
摘要
无模型强化学习以内存和计算效率高、更适用于大规模问题而著称。本文针对学习无限时域平均奖励马尔可夫决策过程(MDPs)引入了两种无模型算法。第一种算法将问题简化为折扣奖励版本,在弱连通MDPs的最小假设下,经过T步后达到的遗憾界。据我们所知,这是该设定下针对一般MDPs的首个无模型算法。第二种算法利用对抗性多臂老虎机自适应算法的最新进展,将遗憾界改进至,尽管需要更强的遍历性假设。这一结果显著优于Abbasi-Yadkori等人(2019a)针对无限时域平均奖励设定下遍历MDPs提出的唯一现有无模型算法所达到的遗憾界。
引用
@article{arxiv.1910.07072,
title = {Model-free Reinforcement Learning in Infinite-horizon Average-reward Markov Decision Processes},
author = {Chen-Yu Wei and Mehdi Jafarnia-Jahromi and Haipeng Luo and Hiteshi Sharma and Rahul Jain},
journal= {arXiv preprint arXiv:1910.07072},
year = {2020}
}