在平均奖励MDP中实现可处理的极小化最优遗憾
机器学习
2024-06-04 v1 系统与控制
系统与控制
最优化与控制
机器学习
摘要
近年来,学习平均奖励马尔可夫决策过程(MDPs)引起了广泛关注。然而,现有算法要么具有次优的遗憾保证,要么计算效率低下。在本文中,我们提出了第一个具有极小化最优遗憾 的可处理算法,其中 是最优偏差函数 的跨度, 是状态-动作空间的大小, 是学习步数。值得注意的是,我们的算法不需要关于 的先验信息。我们的算法依赖于一个新的子程序——投影缓和扩展值迭代(PMEVI),以高效地计算偏差约束下的最优策略。该子程序可应用于各种先前的算法以改进遗憾界。
引用
@article{arxiv.2406.01234,
title = {Achieving Tractable Minimax Optimal Regret in Average Reward MDPs},
author = {Victor Boone and Zihan Zhang},
journal= {arXiv preprint arXiv:2406.01234},
year = {2024}
}