马尔可夫决策过程中的主动探索
机器学习
2019-03-01 v1 机器学习
摘要
我们引入马尔可夫决策过程(MDP)中的主动探索问题。MDP的每个状态由一个随机值刻画,学习器应收集样本以尽可能准确地估计每个状态的平均值。类似于多臂老虎机(MAB)中的主动探索,各状态可能具有不同水平的噪声,因此噪声越大,所需样本越多。由于噪声水平起初未知,我们需要在探索环境以估计噪声与利用这些估计来计算使均值预测精度最大化的策略之间进行权衡。我们提出一种新颖的学习算法来解决该问题,表明MDP中的主动探索可能比MAB中困难得多。我们还推导了一种启发式过程,以缓解慢混合策略的负面影响。最后,我们在简单的数值模拟上验证了我们的发现。
引用
@article{arxiv.1902.11199,
title = {Active Exploration in Markov Decision Processes},
author = {Jean Tarbouriech and Alessandro Lazaric},
journal= {arXiv preprint arXiv:1902.11199},
year = {2019}
}