乐观强化学习 regret 分布的尾部分析
机器学习
2026-03-18 v3 最优化与控制
摘要
我们推导乐观强化学习在有限时限表格马尔可夫决策过程(其中转移动力学未知)中的 regret 的实例相关尾部界限。我们首先研究一种 UCBVI 类型(基于模型的方法)算法,通过对累积 regret 超过阈值 的概率 进行显式界限分析,超越仅分析 或单个高概率分位点的限制。我们分析了两种自然的探索奖励方案:(i) 依赖于总回合数 的方案,显式包含总回合数 ;(ii) 依赖于当前回合索引的 独立(即时)方案。我们随后在 依赖奖励方案下,对乐观 Q 学习(基于模型的方法)进行分析。在模型基和基于模型的方法中,我们获得的 上界具有明显的两段结构:从实例相关尺度开始的亚高斯尾,随后在转换阈值之后转为亚 Weibull 尾。我们进一步推导了相应的实例相关 期望 regret 界限。该提议算法依赖调谐参数 ,该参数在平衡期望 regret 与 regret 表现亚高斯衰减的范围之间起作用。
引用
@article{arxiv.2511.18247,
title = {Tail Distribution of Regret in Optimistic Reinforcement Learning},
author = {Sajad Khodadadian and Mehrdad Moharrami},
journal= {arXiv preprint arXiv:2511.18247},
year = {2026}
}
备注
27 pages, 0 figures