中文

表格型 MDP 的尖锐间隔相关方差感知 regret 上界

机器学习 2025-06-10 v1 机器学习

摘要

我们考虑表格型 MDP 的间隔相关 regret 上界。我们表明,单调值传播 (Monotonic Value Propagation, MVP) 算法实现了方差感知的间隔相关 regret 上界,形式为 O~((Δh(s,a)>0H2logKVarmaxcΔh(s,a)+Δh(s,a)=0H2VarmaxcΔmin+SAH4(SH))logK),\tilde{O}\left(\left(\sum_{\Delta_h(s,a)>0} \frac{H^2 \log K \land \mathtt{Var}_{\max}^{\text{c}}}{\Delta_h(s,a)} +\sum_{\Delta_h(s,a)=0}\frac{ H^2 \land \mathtt{Var}_{\max}^{\text{c}}}{\Delta_{\mathrm{min}}} + SAH^4 (S \lor H) \right) \log K\right), 其中 HH 为计划时域,SS 为状态数,AA 为动作数,KK 为剂集数。这里,Δh(s,a)=Vh(a)Qh(s,a)\Delta_h(s,a) =V_h^* (a) - Q_h^* (s, a) 表示次优间隔,Δmin:=minΔh(s,a)>0Δh(s,a)\Delta_{\mathrm{min}} := \min_{\Delta_h (s,a) > 0} \Delta_h(s,a)Varmaxc\mathtt{Var}_{\max}^{\text{c}} 表示条件总方差的最大值,计算方式为在所有 (π,h,s)(\pi, h, s) 元组中,对给定策略 π\pi 在步长 hh 访问状态 ss 的轨迹条件下的预期总方差的 maximum。Varmaxc\mathtt{Var}_{\max}^{\text{c}} 刻画了在学习任何 (h,s)(h, s) 对时遇到的最大随机性。我们的结果源于对次优间隔与加权和的新型分析,可能适用于其他算法。为补充本研究,我们建立了一个下界 Ω(Δh(s,a)>0H2VarmaxcΔh(s,a)logK),\Omega \left( \sum_{\Delta_h(s,a)>0} \frac{H^2 \land \mathtt{Var}_{\max}^{\text{c}}}{\Delta_h(s,a)}\cdot \log K\right), 说明即使在最大无条件总方差(不以 (h,s)(h, s) 为条件)趋于零的情况下,Varmaxc\mathtt{Var}_{\max}^{\text{c}} 的依赖性仍是必需的。

关键词

引用

@article{arxiv.2506.06521,
  title  = {Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs},
  author = {Shulun Chen and Runlong Zhou and Zihan Zhang and Maryam Fazel and Simon S. Du},
  journal= {arXiv preprint arXiv:2506.06521},
  year   = {2025}
}

备注

30 pages