随机执行延迟下的树搜索策略优化
人工智能
2024-04-09 v1 机器学习
摘要
马尔可夫决策过程(MDP)的标准假设是智能体的决策立即执行。然而,在机器人和医疗保健等众多现实应用中,动作的执行存在延迟,且延迟值甚至可能是随机的。在本文中,我们引入了随机延迟执行 MDP,这是一种无需状态增广即可处理随机延迟的新形式化方法。我们证明,在给定观测延迟值的情况下,在马尔可夫策略类中进行策略搜索足以达到最优性能,从而扩展了确定性固定延迟的情况。基于这一见解,我们设计了 DEZ,这是一种在马尔可夫策略类上进行优化的基于模型的算法。DEZ 利用蒙特卡洛树搜索,类似于其无延迟变体 EfficientZero,从动作队列中准确推断未来状态。因此,它在处理延迟执行的同时保持了 EfficientZero 的样本效率。通过在 Atari 套件上的一系列实验,我们证明了尽管之前的基线在恒定延迟场景中优于朴素方法,但在面对随机延迟时表现不佳。相比之下,我们的方法在恒定和随机延迟下均显著优于基线。代码可在 http://github.com/davidva1/Delayed-EZ 获取。
引用
@article{arxiv.2404.05440,
title = {Tree Search-Based Policy Optimization under Stochastic Execution Delay},
author = {David Valensi and Esther Derman and Shie Mannor and Gal Dalal},
journal= {arXiv preprint arXiv:2404.05440},
year = {2024}
}
备注
Published in ICLR 2024