中文

乐观强化学习 regret 分布的尾部分析

机器学习 2026-03-18 v3 最优化与控制

摘要

我们推导乐观强化学习在有限时限表格马尔可夫决策过程(其中转移动力学未知)中的 regret 的实例相关尾部界限。我们首先研究一种 UCBVI 类型(基于模型的方法)算法,通过对累积 regret RKR_K 超过阈值 xx 的概率 P(RKx)P(R_K \ge x) 进行显式界限分析,超越仅分析 E[RK]E[R_K] 或单个高概率分位点的限制。我们分析了两种自然的探索奖励方案:(i) 依赖于总回合数 KK 的方案,显式包含总回合数 KK;(ii) 依赖于当前回合索引的 KK 独立(即时)方案。我们随后在 KK 依赖奖励方案下,对乐观 Q 学习(基于模型的方法)进行分析。在模型基和基于模型的方法中,我们获得的 P(RKx)P(R_K \ge x) 上界具有明显的两段结构:从实例相关尺度开始的亚高斯尾,随后在转换阈值之后转为亚 Weibull 尾。我们进一步推导了相应的实例相关 E[RK]E[R_K] 期望 regret 界限。该提议算法依赖调谐参数 α\alpha,该参数在平衡期望 regret 与 regret 表现亚高斯衰减的范围之间起作用。

关键词

引用

@article{arxiv.2511.18247,
  title  = {Tail Distribution of Regret in Optimistic Reinforcement Learning},
  author = {Sajad Khodadadian and Mehrdad Moharrami},
  journal= {arXiv preprint arXiv:2511.18247},
  year   = {2026}
}

备注

27 pages, 0 figures