中文

非平稳环境下的决策制定:基于策略增强的搜索

人工智能 2024-01-23 v2 机器学习

摘要

不确定性下的序列决策存在于许多重要问题中。解决此类问题的两种流行方法是强化学习和在线搜索(例如蒙特卡洛树搜索)。前者通过与环境交互学习策略(通常在执行前完成),后者则利用环境的生成模型在决策时刻采样有希望的动作轨迹。在非平稳环境中,决策制定尤为具有挑战性,因为智能体运行的环境会随时间变化。这两种方法在此类设置中均存在不足:一方面,在执行前学习的策略会在环境变化时过时,而重新学习既耗时又耗费计算资源;另一方面,当运行时间受限时,在线搜索可能返回次优动作。本文介绍了策略增强蒙特卡洛树搜索(PA-MCTS),该方法将过时策略的动作价值估计与使用最新环境模型的在线搜索相结合。我们证明了理论结果,展示了 PA-MCTS 选择单步最优动作的条件,并界定了遵循 PA-MCTS 作为策略时累积的误差。我们在多个 OpenAI Gym 环境中将我们的方法与 AlphaZero(另一种混合规划方法)和深度 Q 学习进行了对比。通过大量实验,我们表明在具有有限时间约束的非平稳设置下,PA-MCTS 优于这些基线方法。

关键词

引用

@article{arxiv.2401.03197,
  title  = {Decision Making in Non-Stationary Environments with Policy-Augmented Search},
  author = {Ava Pettet and Yunuo Zhang and Baiting Luo and Kyle Wray and Hendrik Baier and Aron Laszka and Abhishek Dubey and Ayan Mukhopadhyay},
  journal= {arXiv preprint arXiv:2401.03197},
  year   = {2024}
}

备注

Extended Abstract accepted for presentation at AAMAS 2024