中文

在平均奖励MDP中实现可处理的极小化最优遗憾

机器学习 2024-06-04 v1 系统与控制 系统与控制 最优化与控制 机器学习

摘要

近年来,学习平均奖励马尔可夫决策过程(MDPs)引起了广泛关注。然而,现有算法要么具有次优的遗憾保证,要么计算效率低下。在本文中,我们提出了第一个具有极小化最优遗憾 O~(sp(h)SAT)\widetilde{\mathrm{O}}(\sqrt{\mathrm{sp}(h^*) S A T}) 的可处理算法,其中 sp(h)\mathrm{sp}(h^*) 是最优偏差函数 hh^* 的跨度, S×AS \times A 是状态-动作空间的大小, TT 是学习步数。值得注意的是,我们的算法不需要关于 sp(h)\mathrm{sp}(h^*) 的先验信息。我们的算法依赖于一个新的子程序——投影缓和扩展值迭代(PMEVI),以高效地计算偏差约束下的最优策略。该子程序可应用于各种先前的算法以改进遗憾界。

关键词

引用

@article{arxiv.2406.01234,
  title  = {Achieving Tractable Minimax Optimal Regret in Average Reward MDPs},
  author = {Victor Boone and Zihan Zhang},
  journal= {arXiv preprint arXiv:2406.01234},
  year   = {2024}
}