具有树一致保证的简化信念依赖奖励MCTS规划
人工智能
2021-06-01 v1 机器人学
摘要
部分可观测马尔可夫决策过程 (POMDPs) 以难解著称。大多数先进的最先进在线求解器利用了蒙特卡洛树搜索 (MCTS) 的思想。这些求解器快速收敛到信念树中最有希望的枝干,避开次优部分。这些算法大多设计用于直接访问状态奖励,并假设信念依赖奖励不过是状态奖励的期望。因此,它们不适用于更一般且本质的信念依赖奖励设定。此类奖励的一个例子是使用信念的一组加权粒子近似的差分熵。这种信息论奖励带来了显著的计算负担。在本文中,我们将简化范式嵌入 MCTS 算法。具体而言,我们提出简化信息论粒子滤波树 (SITH-PFT),一种考虑信息论奖励但避免完全计算它们的 MCTS 算法新变体。我们用自适应的上下界替代信息论奖励的昂贵计算。这些界易于计算,并仅由我们算法的需求收紧。关键的是,我们精确保证获得与显式计算原始信息论奖励的 MCTS 完全相同的信念树与解。我们的方法是通用的;即,任何收敛到奖励界的方案均可轻松插入以实现大幅加速而无任何性能损失。
引用
@article{arxiv.2105.14239,
title = {Simplified Belief-Dependent Reward MCTS Planning with Guaranteed Tree Consistency},
author = {Ori Sztyglic and Andrey Zhitnikov and Vadim Indelman},
journal= {arXiv preprint arXiv:2105.14239},
year = {2021}
}
备注
The first two authors contributed equally to this work