近最优后悔:基于一般离线函数逼近的情境 MDP 的策略优化
机器学习
2026-02-17 v1
摘要
我们提出了 \texttt{OPO-CMDP},这是首个针对随机情境马尔可夫决策过程(CMDP)下的一般离线函数逼近情形下的策略优化算法。我们的方法实现了 的高概率后悔上界,其中 与 分别表示状态空间与动作空间, 表示时隙长度, 表示周期数, 分别用于逼近损失与动态的有限函数类。这也是首个在 与 上实现最优依赖项的后悔上界,直接改进了当前最先进的结果(Qian、Hu 及 Simchi-Levi,2024)。这些结果表明,乐观策略优化为解决 CMDP 提供了一种天然的、计算上优越且理论上接近最优的路径。
引用
@article{arxiv.2602.13706,
title = {Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation},
author = {Orin Levy and Aviv Rosenberg and Alon Cohen and Yishay Mansour},
journal= {arXiv preprint arXiv:2602.13706},
year = {2026}
}