操控专家迭代中自博弈学习所用经验分布
机器学习
2020-06-02 v1 人工智能
机器学习
摘要
专家迭代(ExIt)是一种通过自博弈学习博弈策略的有效框架。ExIt 涉及训练一个策略以模仿树搜索算法(如蒙特卡洛树搜索)的搜索行为,并利用训练后的策略引导该搜索。策略与树搜索随后可通过在引导式树搜索算法实例间的自博弈中所收集的经验而迭代地相互改进。本文概述了三种不同的方法,用于操控自博弈收集数据的分布,以及从收集数据中采样批次进行学习更新的过程。首先,批次中的样本根据其最初经历所在回合的时长进行加权。其次,在 ExIt 框架中应用优先经验回放(Prioritized Experience Replay),以优先采样我们期望从中获得有价值训练信号的经验。第三,使用训练后的探索性策略使自博弈中经历的轨迹多样化。本文总结了这些操控在十四种不同棋盘游戏上评估的训练效果。我们发现某些游戏的早期训练性能有显著提升,而在十四款游戏平均上有轻微改进。
引用
@article{arxiv.2006.00283,
title = {Manipulating the Distributions of Experience used for Self-Play Learning in Expert Iteration},
author = {Dennis J. N. J. Soemers and Éric Piette and Matthew Stephenson and Cameron Browne},
journal= {arXiv preprint arXiv:2006.00283},
year = {2020}
}
备注
Accepted at the IEEE Conference on Games (CoG) 2020