连通马尔可夫决策过程的遗憾下界
机器学习
2025-01-23 v1 机器学习
摘要
本文致力于在问题相关设定中,将遗憾下界扩展到遍历马尔可夫决策过程(MDP)之外。虽然遍历 MDP 的遗憾下界已为人所熟知且可由可处理算法达到,但我们证明了在连通 MDP 中,遗憾下界变得显著更为复杂。我们的下界重新审视了一致学习智能体所必需的探索行为,并进一步解释了与次优区域相比,环境的所有最优区域都必须被过度访问,我们将这一现象称为协同探索。与此同时,我们表明这两种探索和协同探索行为与通过对数尺度下仔细审查导航结构而获得的导航约束相互交织。由此产生的下界被表示为一个优化问题的解,在许多标准 MDP 类别中,该问题可以被特化以恢复现有结果。从计算角度来看,该问题在一般情况下被证明是 -hard 的,事实上,甚至测试其是否属于可行区域也是 coNP-hard 的。我们进一步提供了一种以构造性方式近似该下界的算法。
关键词
引用
@article{arxiv.2501.13013,
title = {The regret lower bound for communicating Markov Decision Processes},
author = {Victor Boone and Odalric-Ambrym Maillard},
journal= {arXiv preprint arXiv:2501.13013},
year = {2025}
}