中文

通信马尔可夫决策过程中的渐近最优遗憾

机器学习 2025-05-26 v1 机器学习

摘要

在本文中,我们提出了一种学习算法,在通信假设下实现了马尔可夫决策过程中平均奖励的渐近最优遗憾。即,给定一个通信马尔可夫决策过程 MM,我们的算法具有遗憾 K(M)log(T)+o(log(T))K(M) \log(T) + \mathrm{o}(\log(T)),其中 TT 为学习步数,K(M)K(M) 为最佳可能常数。该算法通过显式跟踪常数 K(M)K(M) 来最优地学习,然后在探索(次优地行动以获取信息)、共探索(最优地行动以获取信息)和利用(最优地行动以最大化得分)之间平衡权衡。我们进一步证明了函数 K(M)K(M) 是不连续的,这是我们方法面临的一个挑战。为此,我们描述了一种正则化机制,可以从经验数据中任意精确地估计 K(M)K(M)

关键词

引用

@article{arxiv.2505.18064,
  title  = {Asymptotically optimal regret in communicating Markov decision processes},
  author = {Victor Boone},
  journal= {arXiv preprint arXiv:2505.18064},
  year   = {2025}
}