基于动作梯度的蒙特卡洛树搜索用于连续(概率)马尔可夫决策过程
人工智能
2026-05-19 v4 机器人学
摘要
连续状态、动作和观测空间中的在线规划对自主系统来说仍然具有挑战性。虽然蒙特卡洛树搜索(MCTS)通过抽样方式能够有效扩展,但大多数连续(概率)马尔可夫决策过程求解器并未利用基于梯度的动作优化。我们提出了 Action-Gradient MCTS(AGMCTS),一种将全局树搜索与局部梯度-based 动作细化相结合的框架,同时保持一致的价值估计。我们提供了三个关键的理论贡献:(1)针对粒子 belief 状态的动作评分梯度定理;(2)支持频繁动作分支更新的 Multiple Importance Sampling(MIS)树,通过重用先前抽样而无引入估计量漂移;(3)利用面积公式实现对光滑生成模型的可计算动作评分梯度。实验结果表明,AGMCTS 在多个具有挑战性的连续 MDP 和 POMDP 基准测试中超越了最先进的基于抽样的求解器。
引用
@article{arxiv.2503.12181,
title = {Action-Gradient Monte Carlo Tree Search for Non-Parametric Continuous (PO)MDPs},
author = {Idan Lev-Yehudi and Michael Novitsky and Moran Barenboim and Ron Benchetrit and Vadim Indelman},
journal= {arXiv preprint arXiv:2503.12181},
year = {2026}
}