非平稳马尔可夫决策过程:基于模型的强化学习最坏情况方法(扩展版)
机器学习
2020-01-16 v4 机器学习
摘要
本工作解决了非平稳随机环境中鲁棒零样本规划的问题。我们研究随时间演化的马尔可夫决策过程(MDPs),并在该设定下考虑基于模型的强化学习算法。我们提出两个假设:1)环境以有界演化速率连续演化;2)在每个决策时刻已知当前模型但不知其演化。我们的贡献可归纳为四点。1)我们定义了一类特定的 MDP,称之为非平稳 MDP(NSMDP)。通过对转移和奖励函数关于时间施加 Lipschitz 连续假设,引入正则演化的概念;2)我们考虑一个使用环境当前模型但不知其未来演化的规划智能体。这引导我们考虑一种将环境视为对抗性智能体的最坏情况方法;3)遵循该方法,我们提出风险规避树搜索(RATS)算法,一种类似于 Minimax 搜索的零样本基于模型方法;4)我们通过实验说明 RATS 带来的益处,并将其性能与基准基于模型算法进行比较。
引用
@article{arxiv.1904.10090,
title = {Non-Stationary Markov Decision Processes, a Worst-Case Approach using Model-Based Reinforcement Learning, Extended version},
author = {Erwan Lecarpentier and Emmanuel Rachelson},
journal= {arXiv preprint arXiv:1904.10090},
year = {2020}
}
备注
Published at NeurIPS 2019, 17 pages, 3 figures