连续POMDP规划中MCTS的有限时序分析
人工智能
2026-05-11 v1 机器人学
摘要
本文对蒙特卡洛树搜索(MCTS)在部分可观测马尔可夫决策过程(POMDP)中的有限时序分析进行了论文研究,涉及离散和连续观测空间中的概率浓度边界。虽然POMCP等MCTS式求解器在许多应用中取得了经验成功,但由于启发式动作选择(如UCB)引起的非平稳性和相互依赖性,严格的有限时序保证仍是开放问题。在离散设置中,我们通过将多项式探索奖励扩展到POMDP中的UCB,得出对根节点的经验价值估计的多项式浓度边界。在连续观测空间中,我们引入抽象分区框架,提出分区损失的有限时序边界。在温和条件下,我们证明了在连续观测空间的POMDP中,对价值估计的高概率边界。具体而言,我们提出了Voro-POMCPOW,这是一种结合有限时序保证的POMCPOW变体,通过Voronoi单元自适应分区连续观测空间。该方法保持有限分支因子,同时保留原始观测生成器。实证验证表明,提出的Voro-POMCPOW在提供理论保证的同时表现出竞争力。虽然我们的分析聚焦于连续POMDP,但本文所发展技术也适用于连续MDP,弥合了另一侧的MDP问题。
引用
@article{arxiv.2605.07703,
title = {Finite-Time Analysis of MCTS in Continuous POMDP Planning},
author = {Da Kong and Vadim Indelman},
journal= {arXiv preprint arXiv:2605.07703},
year = {2026}
}
备注
9 pages, 1 figure