在非平稳马尔可夫策略下作用于延迟环境
机器学习
2023-12-14 v4 人工智能
摘要
标准马尔可夫决策过程(MDP)公式依赖于动作在被选择后立即执行的假设。然而,该假设往往不现实,并可能在机器人操控、云计算和金融等应用中导致灾难性失败。我们引入一种在MDP中学习和规划的框架,其中决策者在提交动作后,该动作延迟m步执行。我们将状态与最后m个已提交动作拼接的暴力状态增广基线在m上呈指数级复杂度,如我们在策略迭代中所展示的。随后我们证明,在执行延迟下,原始状态空间中的确定性马尔可夫策略足以获得最大回报,但需为非平稳的。而对于平稳马尔可夫策略,我们证明其在一般情况下是次优的。因此,我们设计了一种非平稳Q学习风格的基于模型的算法,可在不借助状态增广的情况下解决延迟执行任务。在表格、物理和Atari域上的实验表明,即便在大幅延迟下它也能快速收敛到高性能,而忽略延迟或依赖状态增广的标准方法因发散而挣扎或失败。代码见github.com/galdl/rl_delay_basic与github.com/galdl/rl_delay_atari。
引用
@article{arxiv.2101.11992,
title = {Acting in Delayed Environments with Non-Stationary Markov Policies},
author = {Esther Derman and Gal Dalal and Shie Mannor},
journal= {arXiv preprint arXiv:2101.11992},
year = {2023}
}
备注
Published in ICLR 2021