中文

平均奖励马尔可夫决策过程中探索的对数 regret

机器学习 2025-12-01 v2 机器学习

摘要

在平均奖励马尔可夫决策过程中,针对regret最小化的最新算法遵循一个 well-established 框架:它们是基于模型的、乐观的,并且是分段的。首先,它们维护一个置信区域,从中计算出使用称为扩展值迭代 (EVI) 的著名子程序的乐观政策。其次,这些政策被用于称为削减技巧 (DT) 或其变体的每个时间窗口称为剂段。本文中,我们在不修改 EVI 的情况下,展示了将 (DT) 替换为另一个简单规则(称为消失乘法 (VM) 规则)的显著优势。当使用 (VM) 管理剂段时,算法的 regret 在理论和实践中都与 (DT) 一样好甚至更好,而单次行为则大幅改善。更具体地说,对于坏剂段(正在使用次优政策)的管理在 (VM) 下比 (DT) 好得多,通过将探索的 regret 从线性变为对数。这些结果得益于对置信区域在良好和坏剂段中不同行为的全新深入理解。

关键词

引用

@article{arxiv.2502.06480,
  title  = {Logarithmic Regret of Exploration in Average Reward Markov Decision Processes},
  author = {Victor Boone and Bruno Gaujal},
  journal= {arXiv preprint arXiv:2502.06480},
  year   = {2025}
}