块马尔可夫决策过程中的渐近最优强化学习
机器学习
2025-10-16 v1 概率论
机器学习
摘要
维度灾难使得强化学习(RL)在具有指数级状态和动作空间的许多现实场景中不切实际。然而,许多环境展现出可利用的结构,可以加速学习。为了形式化这一思想,我们研究了块马尔可夫决策过程(BMDP)中的强化学习。BMDP 对具有大观测空间但转移动态完全由潜在状态决定的问题进行建模。聚类方法的最新进展使得能够有效恢复这种潜在结构。然而,利用这些技术来确定其对学习性能影响的遗憾分析仍然悬而未决。我们现在通过提供一种明确利用聚类的遗憾分析来填补这一空白,证明准确的潜在状态估计确实可以有效加速学习。具体来说,本文分析了一种用于 BMDP 的两阶段强化学习算法,该算法首先通过随机探索学习潜在结构,然后切换到适应已发现结构的乐观引导策略。该算法在一大类易于聚类的 BMDP 上实现了 的遗憾。这里, 表示时间步数, 是观测空间的基数,而朗道符号 在常数和对数因子下成立。这改进了先前的最佳界 ,尤其是在 很大时。此外,我们证明了在同一类 BMDP 上,没有任何算法能够一致地实现更低的遗憾。这确立了在该类问题上,该算法实现了渐近最优性。
引用
@article{arxiv.2510.13748,
title = {Asymptotically optimal reinforcement learning in Block Markov Decision Processes},
author = {Thomas van Vuren and Fiona Sloothaak and Maarten G. Wolf and Jaron Sanders},
journal= {arXiv preprint arXiv:2510.13748},
year = {2025}
}
备注
74 pages, 3 figures