未知离散马尔可夫决策过程的近最优贝叶斯解
机器学习
2019-07-11 v2 人工智能
计算机科学与博弈论
机器学习
摘要
我们处理在未知有限离散马尔可夫决策过程(MDP)中行动的问题,其中从任意状态到任意其他状态的期望最短路径以有限数 为界。一个 MDP 由 个状态和每个状态 个可能动作组成。在状态 选择动作 后,收到实值奖励 ,然后转移到下一状态 。奖励 由仅依赖于 的固定奖励分布生成,类似地,下一状态 由仅依赖于 的固定转移分布生成。目标是在 次交互后最大化累积奖励。本文考虑奖励分布、转移、 和 均未知的情形。我们推导出首个多项式时间贝叶斯算法 BUCRL,其在对数因子以内达到最优阶 的遗憾(即最优策略与我们算法的累积奖励之差)。重要的是,我们的结果对最坏情形(频率派)遗憾以高概率成立,而非较弱的贝叶斯遗憾概念。我们在多种环境中进行实验,证明了我们的算法优于先前技术。我们的工作还阐明了若干具有独立意义的结论。特别地,我们推导出 Bernoulli 随机变量 KL 散度的更紧上界。我们还推导出 Beta 与 Binomial 分位数的更紧上下界。所有界都非常简单且只使用初等函数。
引用
@article{arxiv.1906.09114,
title = {Near-optimal Bayesian Solution For Unknown Discrete Markov Decision Process},
author = {Aristide Tossou and Christos Dimitrakakis and Debabrota Basu},
journal= {arXiv preprint arXiv:1906.09114},
year = {2019}
}
备注
Improved the text and added detailed proofs of claims Change title to better express the solution proposed