中文

在线 CMDP 中无模型、后悔最优的最佳策略辨识

机器学习 2024-04-16 v5

摘要

本文考虑在线约束马尔可夫决策过程(CMDP)中的最佳策略辨识(BPI)问题。我们关注无模型、具有低后悔值并能以高概率辨识出近似最优策略的算法。现有的具有次线性后悔与约束违背的在线 CMDP 无模型算法,不提供向最优策略收敛的任何保证,且仅当从所有曾用策略中均匀随机采样时给出平均性能保证。本文基于先前证明的 CMDP 基本结构性质(我们称之为有限随机性)开发了一种名为剪枝-精炼-辨识(PRI)的新算法。该性质表明,对于具有 NN 个约束的 CMDP,存在一个至多含 NN 个随机决策的最优策略。所提算法首先辨识必须在哪一步及哪一状态下采取随机决策,然后微调这些随机决策的分布。PRI 实现了三重目标:(i)PRI 是无模型算法;(ii)其在学习结束时以高概率输出近似最优策略;(iii)PRI 保证 O~(HK)\tilde{\mathcal{O}}(H\sqrt{K}) 的后悔值与约束违背,这显著改进了无模型算法下现有最佳后悔界 O~(H4SAK45)\tilde{\mathcal{O}}(H^4 \sqrt{SA}K^{\frac{4}{5}}),其中 HH 为每幕长度,SS 为状态数,AA 为动作数,学习期间总幕数为 2K+O~(K0.25)2K+\tilde{\cal O}(K^{0.25})。我们进一步通过一个例子给出匹配下界,表明在任何在线学习算法下,存在一个良分离 CMDP 实例使得后悔或违背必为 Ω(HK)\Omega(H\sqrt{K}),其与上界仅相差多对数因子。

关键词

引用

@article{arxiv.2309.15395,
  title  = {Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs},
  author = {Zihan Zhou and Honghao Wei and Lei Ying},
  journal= {arXiv preprint arXiv:2309.15395},
  year   = {2024}
}