延迟观测在在线强化学习中的 minimax 最优策略
机器学习
2026-03-05 v1 机器学习
摘要
我们研究了具有延迟状态观测的强化学习问题,即智能体在若干随机时间步后观察当前状态。我们提出了一种结合增强方法和上置置信界方法的算法。对于表格型马尔可夫决策过程 (MDP),我们推导了 的后悔界,其中 和 分别是状态和动作空间的基数, 是时间 horizon, 是 episode 数, 是最大延迟长度。我们还提供了匹配的下界(在对数因子上),表明我们方法的最优性。我们的分析框架将此问题建模为更广泛类 MDP 的一个特例,其中其转移动力学分解为已知组件和结构化但未知组件。我们在这个抽象设置下建立了一般性结果,可能独具兴趣。
引用
@article{arxiv.2603.03480,
title = {Minimax Optimal Strategy for Delayed Observations in Online Reinforcement Learning},
author = {Harin Lee and Kevin Jamieson},
journal= {arXiv preprint arXiv:2603.03480},
year = {2026}
}