中文

带峰值约束的马尔可夫决策过程的强化学习

最优化与控制 2019-12-09 v2 机器学习

摘要

在本文中,我们考虑带峰值约束的马尔可夫决策过程(MDP)的强化学习,其中智能体选择策略以优化目标并同时满足附加约束。智能体必须基于观测到的状态、奖励输出和约束输出采取行动,而对动态、奖励函数和/或约束函数的知识一无所知。我们引入一种博弈论方法来构造强化学习算法,其中智能体最大化一个无约束目标,该目标依赖于最小化对手的模拟动作(对手在有限动作集上作用)以及约束函数(奖励)的输出数据。我们证明由极大极小 Q-learning 得到的策略收敛到最优策略。据我们所知,这是首次有学习算法保证对于带峰值约束的 MDP 问题(无论折扣奖励还是期望平均奖励)收敛到最优平稳策略。

关键词

引用

@article{arxiv.1901.07839,
  title  = {Reinforcement Learning of Markov Decision Processes with Peak Constraints},
  author = {Ather Gattami},
  journal= {arXiv preprint arXiv:1901.07839},
  year   = {2019}
}