中文

基于动作梯度的蒙特卡洛树搜索用于连续(概率)马尔可夫决策过程

人工智能 2026-05-19 v4 机器人学

摘要

连续状态、动作和观测空间中的在线规划对自主系统来说仍然具有挑战性。虽然蒙特卡洛树搜索(MCTS)通过抽样方式能够有效扩展,但大多数连续(概率)马尔可夫决策过程求解器并未利用基于梯度的动作优化。我们提出了 Action-Gradient MCTS(AGMCTS),一种将全局树搜索与局部梯度-based 动作细化相结合的框架,同时保持一致的价值估计。我们提供了三个关键的理论贡献:(1)针对粒子 belief 状态的动作评分梯度定理;(2)支持频繁动作分支更新的 Multiple Importance Sampling(MIS)树,通过重用先前抽样而无引入估计量漂移;(3)利用面积公式实现对光滑生成模型的可计算动作评分梯度。实验结果表明,AGMCTS 在多个具有挑战性的连续 MDP 和 POMDP 基准测试中超越了最先进的基于抽样的求解器。

关键词

引用

@article{arxiv.2503.12181,
  title  = {Action-Gradient Monte Carlo Tree Search for Non-Parametric Continuous (PO)MDPs},
  author = {Idan Lev-Yehudi and Michael Novitsky and Moran Barenboim and Ron Benchetrit and Vadim Indelman},
  journal= {arXiv preprint arXiv:2503.12181},
  year   = {2026}
}