中文

通过策略优化缩小对抗性MDP与随机MDP之间的差距

机器学习 2025-03-06 v2

摘要

我们考虑在全信息设置下与oblivious对手进行的对抗式马尔可夫决策过程[MDP]中的学习问题。智能体在由 TT 个回合组成的环境中进行交互,每个回合包含 HH 个阶段,每个回合根据在回合结束后才会揭示的奖励函数进行评估。我们提出了一种算法,称为 APO-MVP,实现了 O~(poly(H)SAT)\tilde{\mathcal{O}}(\mathrm{poly}(H)\sqrt{SAT}) 阶的regret上限,其中 SSAA 分别是状态和动作空间的大小。这一结果在 SS 因子上改进了已知最佳regret上限,缩小了对抗性MDP与随机MDP之间的差距,并在 S,A,TS,A,T 的依赖关系上匹配了minimax下界 Ω(H3SAT)\Omega(\sqrt{H^3SAT})。该提议算法和分析完全避免了占用措施通常的工具;相反,它仅基于动态编程和在估计的优势函数上运行的黑箱在线线性优化策略进行策略优化,使其易于实现。分析利用了两项最新技术:基于在线线性优化策略的策略优化(Jonckheere 等,2023)以及对估计转移核对值的影响进行精细鞅分析(Zhang 等,2023)。

关键词

引用

@article{arxiv.2407.05704,
  title  = {Narrowing the Gap between Adversarial and Stochastic MDPs via Policy Optimization},
  author = {Daniil Tiapkin and Evgenii Chzhen and Gilles Stoltz},
  journal= {arXiv preprint arXiv:2407.05704},
  year   = {2025}
}