在线 CMDP 中无模型、后悔最优的最佳策略辨识
机器学习
2024-04-16 v5
摘要
本文考虑在线约束马尔可夫决策过程(CMDP)中的最佳策略辨识(BPI)问题。我们关注无模型、具有低后悔值并能以高概率辨识出近似最优策略的算法。现有的具有次线性后悔与约束违背的在线 CMDP 无模型算法,不提供向最优策略收敛的任何保证,且仅当从所有曾用策略中均匀随机采样时给出平均性能保证。本文基于先前证明的 CMDP 基本结构性质(我们称之为有限随机性)开发了一种名为剪枝-精炼-辨识(PRI)的新算法。该性质表明,对于具有 个约束的 CMDP,存在一个至多含 个随机决策的最优策略。所提算法首先辨识必须在哪一步及哪一状态下采取随机决策,然后微调这些随机决策的分布。PRI 实现了三重目标:(i)PRI 是无模型算法;(ii)其在学习结束时以高概率输出近似最优策略;(iii)PRI 保证 的后悔值与约束违背,这显著改进了无模型算法下现有最佳后悔界 ,其中 为每幕长度, 为状态数, 为动作数,学习期间总幕数为 。我们进一步通过一个例子给出匹配下界,表明在任何在线学习算法下,存在一个良分离 CMDP 实例使得后悔或违背必为 ,其与上界仅相差多对数因子。
引用
@article{arxiv.2309.15395,
title = {Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs},
author = {Zihan Zhou and Honghao Wei and Lei Ying},
journal= {arXiv preprint arXiv:2309.15395},
year = {2024}
}