使用谱方法的富观测 MDP 中的强化学习
人工智能
2018-06-21 v4 机器学习
机器学习
摘要
在具有大状态空间的马尔可夫决策过程(MDPs)中的强化学习(RL)是一个具有挑战性的问题。标准 RL 算法的性能随状态空间维度急剧下降。然而,实践中这些大型 MDP 通常包含潜在的或隐藏的低维结构。本文中,我们研究富观测马尔可夫决策过程(ROMDP)的设置,其中存在少量隐藏状态,这些状态到观测状态具有单射映射。换言之,每个观测状态通过单一隐藏状态生成,且该映射先验未知。我们引入一种谱分解方法,一致地学习该映射,更重要的是以低后悔度实现它。估计的映射被集成到一个乐观 RL 算法(UCRL)中,该算法在估计的隐藏空间上运行。我们推导了算法在有限时间内的后悔界,其对观测空间维度的依赖性较弱。事实上,我们的算法渐近地达到了与预言 UCRL 算法相同的平均后悔度,后者具有从隐藏到观测空间的映射知识。因此,我们推导出了一种用于 ROMDP 的高效谱 RL 算法。
引用
@article{arxiv.1611.03907,
title = {Reinforcement Learning in Rich-Observation MDPs using Spectral Methods},
author = {Kamyar Azizzadenesheli and Alessandro Lazaric and Animashree Anandkumar},
journal= {arXiv preprint arXiv:1611.03907},
year = {2018}
}