基于 Eluder 维度的随机上下文 MDP 遗憾界
机器学习
2024-05-30 v3
摘要
我们提出 E-UCRL 算法,用于在随机上下文马尔可夫决策过程(CMDPs)中进行遗憾最小化。该算法在可实现函数类以及可访问\emph{离线}最小二乘与对数损失回归预言机的最小假设下运行。我们的算法是高效的(假设离线回归预言机高效),并享有如下遗憾保证: 其中 为回合次数, 为状态空间, 为动作空间, 为 horizon, 和 分别为用于逼近上下文相关动态与奖励的有限函数类, 为 相对于 Hellinger 距离的 Eluder 维度。据我们所知,我们的算法是首个在通用离线函数逼近设定下运行、且高效且速率最优的 CMDP 遗憾最小化算法。此外,我们将 Eluder 维度推广到一般有界度量,这本身可能具有独立意义。
引用
@article{arxiv.2211.14932,
title = {Eluder-based Regret for Stochastic Contextual MDPs},
author = {Orin Levy and Asaf Cassel and Alon Cohen and Yishay Mansour},
journal= {arXiv preprint arXiv:2211.14932},
year = {2024}
}