中文

延迟观测在在线强化学习中的 minimax 最优策略

机器学习 2026-03-05 v1 机器学习

摘要

我们研究了具有延迟状态观测的强化学习问题,即智能体在若干随机时间步后观察当前状态。我们提出了一种结合增强方法和上置置信界方法的算法。对于表格型马尔可夫决策过程 (MDP),我们推导了 O~(HDmaxSAK)\tilde{\mathcal{O}}(H \sqrt{D_{\max} SAK}) 的后悔界,其中 SSAA 分别是状态和动作空间的基数,HH 是时间 horizon,KK 是 episode 数,DmaxD_{\max} 是最大延迟长度。我们还提供了匹配的下界(在对数因子上),表明我们方法的最优性。我们的分析框架将此问题建模为更广泛类 MDP 的一个特例,其中其转移动力学分解为已知组件和结构化但未知组件。我们在这个抽象设置下建立了一般性结果,可能独具兴趣。

关键词

引用

@article{arxiv.2603.03480,
  title  = {Minimax Optimal Strategy for Delayed Observations in Online Reinforcement Learning},
  author = {Harin Lee and Kevin Jamieson},
  journal= {arXiv preprint arXiv:2603.03480},
  year   = {2026}
}