中文

连续蒙特卡洛图搜索

人工智能 2024-02-08 v3 机器学习 机器人学

摘要

在线规划在许多复杂序贯决策任务中对于高性能至关重要。蒙特卡洛树搜索(MCTS)采用了一种在探索与利用之间进行权衡的规范性机制以实现高效在线规划,并在围棋、国际象棋和将棋等许多离散决策领域优于对比方法。随后,MCTS 向连续域的扩展被提出。然而,固有的高分支因子及由此导致的搜索树规模爆炸限制了现有方法。为解决该问题,我们提出连续蒙特卡洛图搜索(CMCGS),作为 MCTS 在具有连续状态与动作空间环境中的在线规划扩展。CMCGS 利用了如下洞见:在规划期间,多个状态共享同一动作策略可取得高性能。为实现该想法,在每步时刻,CMCGS 将相似状态聚为有限个随机动作赌博机节点,从而生成分层有向图而非 MCTS 搜索树。实验评估表明,在若干复杂连续 DeepMind Control Suite 基准以及具有有限样本预算的 2D 导航与探索任务中,CMCGS 优于可比规划方法。此外,CMCGS 可通过并行化扩展规模,并在带有学习动力学模型的连续控制中优于交叉熵方法(CEM)。

关键词

引用

@article{arxiv.2210.01426,
  title  = {Continuous Monte Carlo Graph Search},
  author = {Kalle Kujanpää and Amin Babadi and Yi Zhao and Juho Kannala and Alexander Ilin and Joni Pajarinen},
  journal= {arXiv preprint arXiv:2210.01426},
  year   = {2024}
}

备注

Accepted at AAMAS 2024 (full paper & oral)