表格型 MDP 的尖锐间隔相关方差感知 regret 上界
机器学习
2025-06-10 v1 机器学习
摘要
我们考虑表格型 MDP 的间隔相关 regret 上界。我们表明,单调值传播 (Monotonic Value Propagation, MVP) 算法实现了方差感知的间隔相关 regret 上界,形式为 O ~ ( ( ∑ Δ h ( s , a ) > 0 H 2 log K ∧ V a r max c Δ h ( s , a ) + ∑ Δ h ( s , a ) = 0 H 2 ∧ V a r max c Δ m i n + S A H 4 ( S ∨ H ) ) log K ) , \tilde{O}\left(\left(\sum_{\Delta_h(s,a)>0} \frac{H^2 \log K \land \mathtt{Var}_{\max}^{\text{c}}}{\Delta_h(s,a)} +\sum_{\Delta_h(s,a)=0}\frac{ H^2 \land \mathtt{Var}_{\max}^{\text{c}}}{\Delta_{\mathrm{min}}} + SAH^4 (S \lor H) \right) \log K\right), O ~ Δ h ( s , a ) > 0 ∑ Δ h ( s , a ) H 2 log K ∧ Var m a x c + Δ h ( s , a ) = 0 ∑ Δ min H 2 ∧ Var m a x c + S A H 4 ( S ∨ H ) log K , 其中 H H H 为计划时域,S S S 为状态数,A A A 为动作数,K K K 为剂集数。这里,Δ h ( s , a ) = V h ∗ ( a ) − Q h ∗ ( s , a ) \Delta_h(s,a) =V_h^* (a) - Q_h^* (s, a) Δ h ( s , a ) = V h ∗ ( a ) − Q h ∗ ( s , a ) 表示次优间隔,Δ m i n : = min Δ h ( s , a ) > 0 Δ h ( s , a ) \Delta_{\mathrm{min}} := \min_{\Delta_h (s,a) > 0} \Delta_h(s,a) Δ min := min Δ h ( s , a ) > 0 Δ h ( s , a ) 。V a r max c \mathtt{Var}_{\max}^{\text{c}} Var m a x c 表示条件总方差的最大值,计算方式为在所有 ( π , h , s ) (\pi, h, s) ( π , h , s ) 元组中,对给定策略 π \pi π 在步长 h h h 访问状态 s s s 的轨迹条件下的预期总方差的 maximum。V a r max c \mathtt{Var}_{\max}^{\text{c}} Var m a x c 刻画了在学习任何 ( h , s ) (h, s) ( h , s ) 对时遇到的最大随机性。我们的结果源于对次优间隔与加权和的新型分析,可能适用于其他算法。为补充本研究,我们建立了一个下界 Ω ( ∑ Δ h ( s , a ) > 0 H 2 ∧ V a r max c Δ h ( s , a ) ⋅ log K ) , \Omega \left( \sum_{\Delta_h(s,a)>0} \frac{H^2 \land \mathtt{Var}_{\max}^{\text{c}}}{\Delta_h(s,a)}\cdot \log K\right), Ω Δ h ( s , a ) > 0 ∑ Δ h ( s , a ) H 2 ∧ Var m a x c ⋅ log K , 说明即使在最大无条件总方差(不以 ( h , s ) (h, s) ( h , s ) 为条件)趋于零的情况下,V a r max c \mathtt{Var}_{\max}^{\text{c}} Var m a x c 的依赖性仍是必需的。
引用
@article{arxiv.2506.06521,
title = {Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs},
author = {Shulun Chen and Runlong Zhou and Zihan Zhang and Maryam Fazel and Simon S. Du},
journal= {arXiv preprint arXiv:2506.06521},
year = {2025}
}
备注
30 pages