分块 MDP 中的高效强化学习:一种无模型表示学习方法
机器学习
2022-10-12 v3 人工智能
摘要
我们提出 BRIEE(Block-structured Representation learning with Interleaved Explore Exploit,交错探索利用的块结构表示学习),一种用于具有块结构动态(即分块 MDP)的马尔可夫决策过程中高效强化学习的算法,其中丰富的观测由一组未知潜在状态生成。BRIEE 将潜在状态发现、探索和利用交错在一起,并且可证明能以在潜在状态数、动作数和时间范围上多项式缩放的样本复杂度学习到近最优策略,且不依赖于可能无限的观测空间的大小。在实验上,我们表明在需要深度探索的困难丰富观测组合锁问题上,BRIEE 比最先进的分块 MDP 算法 HOMER 及其他经验 RL 基线具有更高的样本效率。
引用
@article{arxiv.2202.00063,
title = {Efficient Reinforcement Learning in Block MDPs: A Model-free Representation Learning Approach},
author = {Xuezhou Zhang and Yuda Song and Masatoshi Uehara and Mengdi Wang and Alekh Agarwal and Wen Sun},
journal= {arXiv preprint arXiv:2202.00063},
year = {2022}
}