中文

基于 Eluder 维度的随机上下文 MDP 遗憾界

机器学习 2024-05-30 v3

摘要

我们提出 E-UC3^3RL 算法,用于在随机上下文马尔可夫决策过程(CMDPs)中进行遗憾最小化。该算法在可实现函数类以及可访问\emph{离线}最小二乘与对数损失回归预言机的最小假设下运行。我们的算法是高效的(假设离线回归预言机高效),并享有如下遗憾保证:O~(H3TSAdE(P)log(FP/δ))), \widetilde{O}(H^3 \sqrt{T |S| |A|d_{\mathrm{E}}(\mathcal{P}) \log (|\mathcal{F}| |\mathcal{P}|/ \delta) )}) , 其中 TT 为回合次数,SS 为状态空间,AA 为动作空间,HH 为 horizon,P\mathcal{P}F\mathcal{F} 分别为用于逼近上下文相关动态与奖励的有限函数类,dE(P)d_{\mathrm{E}}(\mathcal{P})P\mathcal{P} 相对于 Hellinger 距离的 Eluder 维度。据我们所知,我们的算法是首个在通用离线函数逼近设定下运行、且高效且速率最优的 CMDP 遗憾最小化算法。此外,我们将 Eluder 维度推广到一般有界度量,这本身可能具有独立意义。

关键词

引用

@article{arxiv.2211.14932,
  title  = {Eluder-based Regret for Stochastic Contextual MDPs},
  author = {Orin Levy and Asaf Cassel and Alon Cohen and Yishay Mansour},
  journal= {arXiv preprint arXiv:2211.14932},
  year   = {2024}
}