中文

近最优后悔:基于一般离线函数逼近的情境 MDP 的策略优化

机器学习 2026-02-17 v1

摘要

我们提出了 \texttt{OPO-CMDP},这是首个针对随机情境马尔可夫决策过程(CMDP)下的一般离线函数逼近情形下的策略优化算法。我们的方法实现了 O~(H4TSAlog(FP))\widetilde{O}(H^4\sqrt{T|S||A|\log(|\mathcal{F}||\mathcal{P}|)}) 的高概率后悔上界,其中 SSAA 分别表示状态空间与动作空间,HH 表示时隙长度,TT 表示周期数,F,P\mathcal{F}, \mathcal{P} 分别用于逼近损失与动态的有限函数类。这也是首个在 S|S|A|A| 上实现最优依赖项的后悔上界,直接改进了当前最先进的结果(Qian、Hu 及 Simchi-Levi,2024)。这些结果表明,乐观策略优化为解决 CMDP 提供了一种天然的、计算上优越且理论上接近最优的路径。

关键词

引用

@article{arxiv.2602.13706,
  title  = {Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation},
  author = {Orin Levy and Aviv Rosenberg and Alon Cohen and Yishay Mansour},
  journal= {arXiv preprint arXiv:2602.13706},
  year   = {2026}
}