中文

利用在线函数近似实现对抗性上下文 MDP 的高效速率最优遗憾

机器学习 2023-08-15 v2

摘要

我们提出 OMG-CMDP! 算法,用于对抗性上下文 MDP 中的遗憾最小化。该算法在可实现函数类以及可访问在线最小二乘与对数损失回归预言机的最小假设下运行。我们的算法是高效的(假设高效的在线回归预言机)、简单且对近似误差鲁棒。它享有 O~(H2.5TSA(R(O)+Hlog(δ1)))\widetilde{O}(H^{2.5} \sqrt{ T|S||A| ( \mathcal{R}(\mathcal{O}) + H \log(\delta^{-1}) )}) 的遗憾保证,其中 TT 为回合次数,SS 为状态空间,AA 为动作空间,HH 为 horizon( horizon 译为:时域),R(O)=R(OsqF)+R(OlogP)\mathcal{R}(\mathcal{O}) = \mathcal{R}(\mathcal{O}_{\mathrm{sq}}^\mathcal{F}) + \mathcal{R}(\mathcal{O}_{\mathrm{log}}^\mathcal{P}) 为回归预言机遗憾之和,分别用于近似上下文相关奖励与动力学。据我们所知,我们的算法是在线函数近似最小标准假设下首个高效的速率最优遗憾最小化算法,用于对抗性 CMDP。

关键词

引用

@article{arxiv.2303.01464,
  title  = {Efficient Rate Optimal Regret for Adversarial Contextual MDPs Using Online Function Approximation},
  author = {Orin Levy and Alon Cohen and Asaf Cassel and Yishay Mansour},
  journal= {arXiv preprint arXiv:2303.01464},
  year   = {2023}
}