中文

基于策略增强蒙特卡洛树搜索的非平稳环境决策

人工智能 2022-03-01 v1

摘要

不确定性下的决策(DMU)存在于许多重要问题中。一个开放的挑战是非平稳环境中的 DMU,其中环境的动态会随时间改变。强化学习(RL)作为 DMU 问题的流行方法,通过离线与环境模型交互来学习策略。不幸的是,如果环境发生变化,策略可能变得陈旧并采取次优动作,而为更新后的环境重新学习策略需要时间与计算代价。另一种选择是在线规划方法,如蒙特卡洛树搜索(MCTS),其在决策时刻执行计算。给定当前环境,MCTS 使用高保真模型进行规划以确定有前景的动作轨迹。这些模型可在检测到环境变化后立即更新,从而将其立即纳入决策。然而,对于具有大状态-动作空间的问题,MCTS 的收敛可能很慢。在本文中,我们提出了一种新颖的混合决策方法,结合了 RL 与规划的优势同时缓解其弱点。我们的方法称为策略增强 MCTS(PA-MCTS),将策略的动作-价值估计整合进 MCTS,利用这些估计来播种搜索偏好的动作轨迹。我们假设 PA-MCTS 将比标准 MCTS 收敛更快,同时在面对非平稳环境时做出比策略单独所能做出的更好的决策。我们通过将 PA-MCTS 与纯 MCTS 及应用于经典 CartPole 环境的 RL 智能体进行比较来检验该假设。我们发现,在若干环境偏移下,PC-MCTS 相比孤立的策略能获得更高的累积奖励,同时比纯 MCTS 在显著更少的迭代次数内收敛。

关键词

引用

@article{arxiv.2202.13003,
  title  = {Decision Making in Non-Stationary Environments with Policy-Augmented Monte Carlo Tree Search},
  author = {Geoffrey Pettet and Ayan Mukhopadhyay and Abhishek Dubey},
  journal= {arXiv preprint arXiv:2202.13003},
  year   = {2022}
}