约束MDP学习中基于奖励偏置最大似然估计的方法
最优化与控制
2021-05-31 v1
摘要
我们使用奖励偏置最大似然估计(RBMLE)算法来学习约束马尔可夫决策过程(CMDPs)的最优策略。我们分析了RBMLE的学习后悔界。
引用
@article{arxiv.2105.13919,
title = {Reward Biased Maximum Likelihood Estimation for Learning in Constrained MDPs},
author = {Rahul Singh},
journal= {arXiv preprint arXiv:2105.13919},
year = {2021}
}
备注
Under preparation. arXiv admin note: text overlap with arXiv:2011.07738