中文

用于策略优化的蒙特卡洛树搜索

机器学习 2019-12-24 v1 人工智能 机器学习

摘要

基于梯度的方法常用于深度强化学习中的策略优化,尽管其易受局部最优和鞍点影响。尽管无梯度方法(如遗传算法或进化策略)有助于缓解这些问题,但在高度非凸空间中,糟糕的初始化和局部最优仍是隐患。本文提出一种基于蒙特卡洛树搜索和无梯度优化的策略优化方法。我们的方法称为用于策略优化的蒙特卡洛树搜索(MCTSPO),通过利用上置信界启发式提供了更好的探索-利用权衡。与流行的基于梯度的方法和深度遗传算法基线相比,我们在具有欺骗性或稀疏奖励函数的强化学习任务上展示了改进的性能。

关键词

引用

@article{arxiv.1912.10648,
  title  = {Monte-Carlo Tree Search for Policy Optimization},
  author = {Xiaobai Ma and Katherine Driggs-Campbell and Zongzhang Zhang and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:1912.10648},
  year   = {2019}
}

备注

IJCAI 2019