通信马尔可夫决策过程中的渐近最优遗憾
机器学习
2025-05-26 v1 机器学习
摘要
在本文中,我们提出了一种学习算法,在通信假设下实现了马尔可夫决策过程中平均奖励的渐近最优遗憾。即,给定一个通信马尔可夫决策过程 ,我们的算法具有遗憾 ,其中 为学习步数, 为最佳可能常数。该算法通过显式跟踪常数 来最优地学习,然后在探索(次优地行动以获取信息)、共探索(最优地行动以获取信息)和利用(最优地行动以最大化得分)之间平衡权衡。我们进一步证明了函数 是不连续的,这是我们方法面临的一个挑战。为此,我们描述了一种正则化机制,可以从经验数据中任意精确地估计 。
引用
@article{arxiv.2505.18064,
title = {Asymptotically optimal regret in communicating Markov decision processes},
author = {Victor Boone},
journal= {arXiv preprint arXiv:2505.18064},
year = {2025}
}