中文

约束MDP学习中基于奖励偏置最大似然估计的方法

最优化与控制 2021-05-31 v1

摘要

我们使用奖励偏置最大似然估计(RBMLE)算法来学习约束马尔可夫决策过程(CMDPs)的最优策略。我们分析了RBMLE的学习后悔界。

关键词

引用

@article{arxiv.2105.13919,
  title  = {Reward Biased Maximum Likelihood Estimation for Learning in Constrained MDPs},
  author = {Rahul Singh},
  journal= {arXiv preprint arXiv:2105.13919},
  year   = {2021}
}

备注

Under preparation. arXiv admin note: text overlap with arXiv:2011.07738