通过隐状态解码实现具有丰富观测下可证明高效的强化学习
机器学习
2021-09-10 v3 机器学习
摘要
我们研究由少量隐状态生成丰富观测的分幕 MDP 中的探索问题。在若干可辨识性假设下,我们展示了如何通过一系列回归与聚类步骤归纳地估计从观测到隐状态的映射——其中先前解码的隐状态为后续回归问题提供标签——并用其构建良好的探索策略。我们给出了所学状态解码函数与探索策略质量的有限样本保证,并以一类困难探索问题的实证评估补充我们的理论。即便 Q-learning 作弊式地获知隐状态,我们的方法相对带朴素探索的 Q-learning 仍有指数级改进。
引用
@article{arxiv.1901.09018,
title = {Provably efficient RL with Rich Observations via Latent State Decoding},
author = {Simon S. Du and Akshay Krishnamurthy and Nan Jiang and Alekh Agarwal and Miroslav Dudík and John Langford},
journal= {arXiv preprint arXiv:1901.09018},
year = {2021}
}
备注
The ICML 2019 version omitted the second constraint on $\epsilon$ in Theorem 4.1. We thank Yonathan Efroni for calling this to our attention